معرفی GPT-6 Astra؛ قابلیت‌ها، قیمت و تغییرات مهم

پ

پژوهش ژرف

تحریریه معرفی مدل‌ها

۱۴ شهریور ۱۴۰۵۹ دقیقه مطالعه
معرفی GPT-6 Astra؛ قابلیت‌ها، قیمت و تغییرات مهم

شرکت OpenAI مدل GPT-6 Astra را در ۳ سپتامبر ۲۰۲۶ معرفی کرد. عرضه آن به‌تدریج در طرح‌های پولی ChatGPT، رابط برنامه‌نویسی، Azure و Bedrock انجام می‌شود. این مقاله برای توسعه‌دهندگان، گروه‌های پژوهشی و مدیرانی نوشته شده که می‌خواهند بدانند ارزیابی مدل تازه را از کجا آغاز کنند. برداشت تحریریه ما این است که استرا برای کارهایی که میان چند ابزار جابه‌جا می‌شوند و باید به یک خروجی قابل‌استفاده برسند، ارزش بررسی ویژه دارد. این برداشت به معنی توصیه به جایگزینی همه مسیرهای فعلی نیست.

اعلام رسمی عرضه منبع خبر و جدول ارزیابی زیر است. برنامه عرضه، تأیید دسترسی حساب شما محسوب نمی‌شود. این بررسی در ۵ سپتامبر تهیه شده است؛ پیش از زمان‌بندی مهاجرت، دسترسی و شرایط تجاری را دوباره بررسی کنید.

تصویر جلد: اثر رسمی OpenAI برای معرفی GPT-6 Astra که برای پوشش این خبر بازنشر شده است. تصویر، نمایانگر معرفی محصول است و شاهدی برای عملکرد مدل در آزمون‌ها نیست.

این معرفی برای کار روزمره چه معنایی دارد؟

برای بررسی این عرضه، سه پرسش را از هم جدا کنید: آیا مدل بخش دشوار مسئله را حل می‌کند؟ آیا برنامه‌ای که مدل در آن اجرا می‌شود می‌تواند مراحل لازم را انجام دهد؟ آیا بازبین می‌تواند درستی نتیجه نهایی را اثبات کند؟ بهتر شدن پاسخ پرسش اول، به‌خودی‌خود دو پرسش دیگر را پاسخ نمی‌دهد.

فرض کنید دستیار باید از یک فایل محاسباتی و چند گزارش، مرور ماهانه عملیات تهیه کند. موفقیت یعنی جمع‌ها تطبیق داشته باشند، دوره‌های مقایسه سازگار باشند، نمودارها با داده‌ها همخوانی داشته باشند و کمبود شواهد مشخص شود. ارائه زیبا با مخرج اشتباه همچنان یک کار ناموفق است. استرا را با همان ورودی‌ها و معیارهای پذیرش سامانه فعلی ارزیابی کنید تا مقایسه واقعاً معنا داشته باشد.

بررسی خانواده GPT-5.6 برای گروه‌هایی که کار را میان چند رده مدل تقسیم می‌کنند، پیش‌زمینه مناسبی است. مسیر کم‌هزینه‌ای را که هم‌اکنون کیفیت کافی دارد حفظ کنید؛ استرا را ابتدا جایی بیازمایید که شکست‌های تکراری و اصلاح انسانی، هزینه واقعی کار را بالا برده‌اند.

پیشرفت آزمون‌ها همراه با نتیجه‌های مخالف

اعداد زیر نتایج گزارش‌شده توسط OpenAI هستند، نه آزمایش ژرف. جدول عرضه، بیشترین امتیاز میان تنظیمات تلاش را گزارش می‌کند؛ ابزارها و دستورهای محیط واقعی می‌توانند متفاوت باشند.

ارزیابیGPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Terminal-Bench 4.0۵۷٫۹٪۳۷٫۳٪۵۵٫۸٪
Terminal-Bench Science 0.1۶۴٫۶٪۲۲٫۴٪۵۲٫۶٪
AutomationBench۴۱٫۴٪۱۸٫۱٪۳۱٫۴٪
FrontierMath Tier 4 (v2)۹۷٫۶٪۸۳٫۰٪۸۷٫۸٪
Humanity's Last Exam با ابزار۵۷٫۲٪گزارش نشده۶۵٫۰٪

ردیف آخر مهم است: این عرضه، برتری در همه زمینه‌ها را اثبات نمی‌کند. همچنین نباید درصدهای آزمون‌های نامرتبط را میانگین گرفت و آن را احتمال موفقیت در محیط کار نامید. یک گردش کار علمی، یک وظیفه پایانه و پاسخ به پرسش با ابزار، شرایط شکست یکسانی ندارند.

این جدول برای انتخاب آزمایش مفید است. اگر مشکل اصلی گروه شما نوشتن برنامه‌های علمی است، کارهای پژوهشی نماینده را انتخاب کنید. اگر یک سرویس قدیمی را نگهداری می‌کنید، تغییر واقعی مخزن، محدودیت وابستگی‌ها و تشخیص خطاهای بازگشتی اولویت دارند. تکرار بهترین نمایش سازنده، معمولاً کمتر از آزمودن کارهایی اطلاعات می‌دهد که همکاران شما مرتب برای اصلاح بازمی‌گردانند.

استفاده از رایانه به معیار پذیرش نیاز دارد

دستیاری که با مرورگر کار می‌کند باید تفاوت صفحه‌ای ظاهراً درست و عملیاتی واقعاً تکمیل‌شده را تشخیص دهد. پذیرش را بر وضعیت قابل‌مشاهده بنا کنید: رکورد ذخیره‌شده، سند خروجی، تأیید قابل‌مشاهده یا خواندن دوباره داده از سامانه مقصد. تصویر صفحه برای ظاهر و تعامل مفید است، اما به‌تنهایی درستی پایگاه داده را اثبات نمی‌کند.

آزمایش مناسب، کاری برگشت‌پذیر در یک محیط نمونه است. از مدل بخواهید رکوردی آزمایشی را ویرایش کند، گزارش بسازد و سپس رکورد را دوباره باز کند و فیلدها را بررسی کند. صفحه کند، نشست منقضی‌شده و خطای اعتبارسنجی را نیز وارد آزمایش کنید. ثبت کنید که عامل بازیابی می‌کند، اطلاعات ضروری می‌پرسد یا به‌اشتباه موفقیت اعلام می‌کند. این‌ها پیشنهاد آزمایش هستند، نه خطاهایی که ما در استرا مشاهده کرده باشیم.

رفتار هنگام تغییر خواسته کاربر را هم مشخص کنید. اصلاح دوره گزارش باید محاسبات قدیمی را نامعتبر کند، اما نباید شرط‌های قبلی درباره واحد پول، منبع داده یا قالب نهایی را بی‌صدا کنار بگذارد. معیار شما باید نتیجه نهایی منطبق با آخرین خواسته و همه محدودیت‌های معتبر باشد.

مشخصات و هزینه واقعی رابط برنامه‌نویسی

کارت رسمی مدل شناسه gpt-6-astra، ظرفیت زمینه ۱٬۰۵۰٬۰۰۰ توکن، حداکثر خروجی ۱۲۸٬۰۰۰ توکن و پایان دانش آموزشی در ۳۰ آوریل ۲۰۲۶ را ثبت کرده است. نرخ استاندارد هر میلیون توکن، ۱۰ دلار ورودی، ۱ دلار ورودی ذخیره‌شده در حافظه نهان، ۱۲٫۵۰ دلار نوشتن حافظه نهان و ۵۰ دلار خروجی است. برای ورودی بیش از ۲۷۲٬۰۰۰ توکن، نرخ ورودی و حافظه نهان برای کل درخواست دو برابر و نرخ خروجی ۱٫۵ برابر می‌شود.

یک محاسبه فرضی ساده: ۱۰۰٬۰۰۰ توکن ورودی بدون حافظه نهان و ۱۰٬۰۰۰ توکن خروجی قابل‌صورتحساب، با نرخ استاندارد ۱٫۵۰ دلار هزینه دارد. برای ۳۰۰٬۰۰۰ توکن ورودی و همان مقدار خروجی، ضرایب زمینه بلند هزینه را به ۶٫۷۵ دلار می‌رسانند. این مثال‌ها هزینه ابزار، نوشتن حافظه نهان، تلاش دوباره و سایر خدمات را شامل نمی‌شوند؛ محاسبه عددی هستند، نه میانگین اندازه‌گیری‌شده هزینه یک کار.

بودجه را بر اساس خروجی پذیرفته‌شده ببندید. تلاش‌های شکست‌خورده و زمان بازبین را نیز حساب کنید و شرایط حافظه نهان را ثبت کنید. صورتحساب پایین وقتی خروجی به اصلاح فراوان نیاز دارد گمراه‌کننده است. در مقابل، نرخ بالاتر ممکن است با کاهش تعداد تلاش‌ها اقتصادی باشد. هیچ‌یک از این دو نتیجه فقط از روی فهرست قیمت مشخص نمی‌شود.

قابلیت‌های تازه عامل‌ها، اجرای کار را تغییر می‌دهند

راهنمای استرا فراخوانی ناهمگام ابزار و دریافت اصلاحات میان اجرا را معرفی می‌کند. فراخوانی ابزار به Responses نیاز دارد. در مهاجرت باید پارامترهای پشتیبانی‌نشده مانند temperature و top_p حذف شوند؛ تلاش استدلالی none نیز پشتیبانی نمی‌شود. تغییر تلاش می‌تواند با configuration_update و حفظ پیشوند درخواست انجام شود.

اجرای ناهمگام را مسئله مدیریت وابستگی‌ها بدانید. وقتی ساخت سند هنوز ادامه دارد، عامل می‌تواند منبع مستقلی را بررسی کند، اما نمی‌تواند اعلام کند فایل نهایی بررسی شده است. برنامه شما باید شناسه فراخوانی‌ها را نگه دارد، نتیجه‌های در انتظار را دنبال کند و پس از اتصال دوباره از اجرای تکراری اثرهای جانبی جلوگیری کند. این‌ها توصیه مهندسی برای استفاده از قابلیت هستند، نه وعده اینکه مدل صف کار شما را خودکار مدیریت می‌کند.

رسیدن نتیجه دیرهنگام پس از اصلاح کاربر را آزمایش کنید. اگر کاربر بازه زمانی را تغییر داد، نتیجه پرس‌وجوی قبلی نباید صرفاً چون دیرتر رسیده، پاسخ نهایی شود. ارتباط میان نسخه درخواست، ورودی ابزار و نتیجه پذیرفته‌شده باید در وضعیت برنامه روشن و قابل‌بررسی باشد.

کار علمی باید بازتولیدپذیر بماند

نتیجه آزمون علمی، استرا را نامزد مناسبی برای یک آزمایش پژوهشی اجرایی می‌کند. مسئله‌ای با ورودی مشخص، محیط مستند و بازبین آشنا با روش انتخاب کنید. فایل محاسباتی یا برنامه، نسخه وابستگی‌ها، بررسی‌های میانی و تفکیک مشاهده از فرضیه را بخواهید.

برای مثال، مدلی که دو گروه آزمایشی را مقایسه می‌کند باید پیش از نتیجه‌گیری، حذف داده‌ها، مقدارهای گمشده و واحد تحلیل را توضیح دهد. از بازبین بخواهید محاسبه را در محیطی پاک دوباره اجرا کند. توضیح متقاعدکننده بدون خروجی بازتولیدپذیر نباید همان امتیاز نتیجه‌ای را بگیرد که اجرای مستقل آن موفق است.

این مقاله هیچ کشف علمی یا کاربرد بالینی را اعتبارسنجی نمی‌کند. پرسش محدودتر است: آیا دستیار زمان رسیدن به خروجی پژوهشی قابل‌بازبینی را کاهش می‌دهد، بدون اینکه استاندارد شواهد ضعیف شود؟ همین را مستقیماً اندازه بگیرید؛ نزدیک شدن به سقف یک آزمون، اثبات حل مسائل پژوهشی ناآشنا نیست.

پیشرفت ایمنی همراه با محدودیت عملیاتی است

مرور ایمنی OpenAI توان سایبری استرا را در آستانه بحرانی چارچوب خود طبقه‌بندی می‌کند و حفاظت‌های قوی‌تر را توضیح می‌دهد. همچنین از مقاومت بهتر در برابر تزریق دستور و چالش‌های نظارت سخن می‌گوید. کارت سامانه شرح تفصیلی ارزیابی‌ها را ارائه می‌کند؛ این‌ها ارزیابی عرضه‌کننده هستند، نه گواهی مستقل ایمنی.

در استقرار، مجوز انجام کار را بیرون از متن متقاعدکننده مدل نگه دارید. سندی که از دستیار می‌خواهد سطح دسترسی را تغییر دهد، محتوایی برای تفسیر است و دستور تازه کاربر نیست. رد شدن مجوز باید به توقف روشن یا گزینه مجاز دیگری منجر شود و اطلاعات کافی برای بازبینی باقی بماند.

کارهای متوقف‌شده و ردشده را هم در آزمایش بگنجانید. وقتی کار در محدوده مجاز تکمیل نمی‌شود، توضیح درست پیش‌نیاز برآورده‌نشده باید نتیجه صحیح محسوب شود. در غیر این صورت، ارزیابی ممکن است ناخواسته به ادعای بی‌پشتوانه موفقیت یا میان‌بر غیرمجاز پاداش بدهد. سیاست پذیرش باید مجوزهای واقعی کسب‌وکار، از جمله اقداماتی که کاربر قبلاً مجاز کرده، را منعکس کند.

مقایسه استرا با Fable 5.1 چگونه انجام شود؟

بررسی Fable 5.1 و Mythos 5.1 عرضه نزدیک به استرا را پوشش می‌دهد. از آن برای شناسایی پرسش‌های مهاجرت استفاده کنید و سپس سامانه‌های فعلی را روی مجموعه کار یکسان مقایسه کنید. اعداد ارزیابی عرضه‌کنندگان مختلف را طوری ترکیب نکنید که گویی ابزار، حفاظت، زمان و روش نمره‌دهی یکسان بوده‌اند.

مقایسه مناسب شامل کار ساده، کار دشوار اما حل‌شدنی و درخواست عمداً ناقص است. پیش از اجرا، داده ورودی و معیار پذیرش را ثابت کنید. شناسه مدل، تلاش، نسخه برنامه، مجوز ابزار، هزینه، زمان و مداخله انسانی را کنار هر نتیجه نگه دارید. در صورت امکان، بازبین نام مدل را نبیند تا هیجان معرفی محصول بر نمره‌دهی اثر نگذارد.

برنامه عملی برای هفته نخست

با مجموعه کوچکی از کارهای تکراری شروع کنید که خروجی درست آن‌ها قابل‌بررسی است. عملکرد مسیر فعلی را ثبت کنید، سپس استرا را در شرایط مشابه اجرا کنید. دقت واقعی، قابلیت استفاده از خروجی، رعایت مجوز و نرخ تکمیل را جدا بسنجید و همه را به یک نمره سلیقه‌ای تقلیل ندهید.

تنها جایی استفاده را گسترش دهید که فایده پس از بازبینی باقی می‌ماند. مسیر قبلی را نگه دارید و شرط بازگشت مشخص کنید؛ مثلاً افزایش ادعاهای بی‌پشتوانه یا خرابی تکراری سند. پیش از استفاده گسترده، ورودی بلند، نشست قطع‌شده، ابزار در دسترس‌نبوده و اطلاعات ناقص کاربر را بیازمایید. محدودیت‌ها را کنار مثال‌های موفق ثبت کنید تا همکاران بدانند شواهد آزمایش تا کجا اعتبار دارند.

پیشنهاد ما ارزیابی استرا ابتدا روی کارهای پرهزینه و چندمرحله‌ای با معیار پذیرش روشن است. معرفی محصول برای توجیه چنین آزمایشی شواهد جذابی دارد؛ تصمیم جایگزینی مسیر موجود باید بر خروجی پذیرفته‌شده، هزینه اندازه‌گیری‌شده و محدودیت‌های عملیاتی خود شما متکی باشد.

یادداشت منابع — بازبینی ۲۰۲۶

بازبینی در ۵ سپتامبر ۲۰۲۶ انجام شد. تاریخ انتشار بالا مربوط به این مقاله است؛ معرفی مدل در ۳ سپتامبر بود. نتایج آزمون به عرضه‌کننده نسبت داده شده‌اند. مثال‌ها و پیشنهادهای پذیرش، تحلیل تحریریه ژرف هستند و برای این مقاله آزمایش مستقل مدل انجام نشده است.

#GPT-6 Astra#OpenAI#عامل هوش مصنوعی#ارزیابی مدل#استفاده از رایانه

مطالب مرتبط

یک فرایند را برای کشف نیاز مشخص کنید

اگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.