
معرفی DeepSeek V4.1 Flash؛ بینایی، قیمت و جایگزینی V4 Pro
دیپسیک در ۱۰ سپتامبر مدل تازه خود را با بینایی بومی و هزینه کمتر معرفی کرد؛ بررسی نتایج، قیمت API و تغییر مهم مسیر درخواستها در ۱۴ سپتامبر.
ادامه مطلبپژوهش ژرف
تحریریه معرفی مدلها

شرکت OpenAI مدل GPT-6 Astra را در ۳ سپتامبر ۲۰۲۶ معرفی کرد. عرضه آن بهتدریج در طرحهای پولی ChatGPT، رابط برنامهنویسی، Azure و Bedrock انجام میشود. این مقاله برای توسعهدهندگان، گروههای پژوهشی و مدیرانی نوشته شده که میخواهند بدانند ارزیابی مدل تازه را از کجا آغاز کنند. برداشت تحریریه ما این است که استرا برای کارهایی که میان چند ابزار جابهجا میشوند و باید به یک خروجی قابلاستفاده برسند، ارزش بررسی ویژه دارد. این برداشت به معنی توصیه به جایگزینی همه مسیرهای فعلی نیست.
اعلام رسمی عرضه منبع خبر و جدول ارزیابی زیر است. برنامه عرضه، تأیید دسترسی حساب شما محسوب نمیشود. این بررسی در ۵ سپتامبر تهیه شده است؛ پیش از زمانبندی مهاجرت، دسترسی و شرایط تجاری را دوباره بررسی کنید.
تصویر جلد: اثر رسمی OpenAI برای معرفی GPT-6 Astra که برای پوشش این خبر بازنشر شده است. تصویر، نمایانگر معرفی محصول است و شاهدی برای عملکرد مدل در آزمونها نیست.
برای بررسی این عرضه، سه پرسش را از هم جدا کنید: آیا مدل بخش دشوار مسئله را حل میکند؟ آیا برنامهای که مدل در آن اجرا میشود میتواند مراحل لازم را انجام دهد؟ آیا بازبین میتواند درستی نتیجه نهایی را اثبات کند؟ بهتر شدن پاسخ پرسش اول، بهخودیخود دو پرسش دیگر را پاسخ نمیدهد.
فرض کنید دستیار باید از یک فایل محاسباتی و چند گزارش، مرور ماهانه عملیات تهیه کند. موفقیت یعنی جمعها تطبیق داشته باشند، دورههای مقایسه سازگار باشند، نمودارها با دادهها همخوانی داشته باشند و کمبود شواهد مشخص شود. ارائه زیبا با مخرج اشتباه همچنان یک کار ناموفق است. استرا را با همان ورودیها و معیارهای پذیرش سامانه فعلی ارزیابی کنید تا مقایسه واقعاً معنا داشته باشد.
بررسی خانواده GPT-5.6 برای گروههایی که کار را میان چند رده مدل تقسیم میکنند، پیشزمینه مناسبی است. مسیر کمهزینهای را که هماکنون کیفیت کافی دارد حفظ کنید؛ استرا را ابتدا جایی بیازمایید که شکستهای تکراری و اصلاح انسانی، هزینه واقعی کار را بالا بردهاند.
اعداد زیر نتایج گزارششده توسط OpenAI هستند، نه آزمایش ژرف. جدول عرضه، بیشترین امتیاز میان تنظیمات تلاش را گزارش میکند؛ ابزارها و دستورهای محیط واقعی میتوانند متفاوت باشند.
| ارزیابی | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | ۵۷٫۹٪ | ۳۷٫۳٪ | ۵۵٫۸٪ |
| Terminal-Bench Science 0.1 | ۶۴٫۶٪ | ۲۲٫۴٪ | ۵۲٫۶٪ |
| AutomationBench | ۴۱٫۴٪ | ۱۸٫۱٪ | ۳۱٫۴٪ |
| FrontierMath Tier 4 (v2) | ۹۷٫۶٪ | ۸۳٫۰٪ | ۸۷٫۸٪ |
| Humanity's Last Exam با ابزار | ۵۷٫۲٪ | گزارش نشده | ۶۵٫۰٪ |
ردیف آخر مهم است: این عرضه، برتری در همه زمینهها را اثبات نمیکند. همچنین نباید درصدهای آزمونهای نامرتبط را میانگین گرفت و آن را احتمال موفقیت در محیط کار نامید. یک گردش کار علمی، یک وظیفه پایانه و پاسخ به پرسش با ابزار، شرایط شکست یکسانی ندارند.
این جدول برای انتخاب آزمایش مفید است. اگر مشکل اصلی گروه شما نوشتن برنامههای علمی است، کارهای پژوهشی نماینده را انتخاب کنید. اگر یک سرویس قدیمی را نگهداری میکنید، تغییر واقعی مخزن، محدودیت وابستگیها و تشخیص خطاهای بازگشتی اولویت دارند. تکرار بهترین نمایش سازنده، معمولاً کمتر از آزمودن کارهایی اطلاعات میدهد که همکاران شما مرتب برای اصلاح بازمیگردانند.
دستیاری که با مرورگر کار میکند باید تفاوت صفحهای ظاهراً درست و عملیاتی واقعاً تکمیلشده را تشخیص دهد. پذیرش را بر وضعیت قابلمشاهده بنا کنید: رکورد ذخیرهشده، سند خروجی، تأیید قابلمشاهده یا خواندن دوباره داده از سامانه مقصد. تصویر صفحه برای ظاهر و تعامل مفید است، اما بهتنهایی درستی پایگاه داده را اثبات نمیکند.
آزمایش مناسب، کاری برگشتپذیر در یک محیط نمونه است. از مدل بخواهید رکوردی آزمایشی را ویرایش کند، گزارش بسازد و سپس رکورد را دوباره باز کند و فیلدها را بررسی کند. صفحه کند، نشست منقضیشده و خطای اعتبارسنجی را نیز وارد آزمایش کنید. ثبت کنید که عامل بازیابی میکند، اطلاعات ضروری میپرسد یا بهاشتباه موفقیت اعلام میکند. اینها پیشنهاد آزمایش هستند، نه خطاهایی که ما در استرا مشاهده کرده باشیم.
رفتار هنگام تغییر خواسته کاربر را هم مشخص کنید. اصلاح دوره گزارش باید محاسبات قدیمی را نامعتبر کند، اما نباید شرطهای قبلی درباره واحد پول، منبع داده یا قالب نهایی را بیصدا کنار بگذارد. معیار شما باید نتیجه نهایی منطبق با آخرین خواسته و همه محدودیتهای معتبر باشد.
کارت رسمی مدل شناسه gpt-6-astra، ظرفیت زمینه ۱٬۰۵۰٬۰۰۰ توکن، حداکثر خروجی ۱۲۸٬۰۰۰ توکن و پایان دانش آموزشی در ۳۰ آوریل ۲۰۲۶ را ثبت کرده است. نرخ استاندارد هر میلیون توکن، ۱۰ دلار ورودی، ۱ دلار ورودی ذخیرهشده در حافظه نهان، ۱۲٫۵۰ دلار نوشتن حافظه نهان و ۵۰ دلار خروجی است. برای ورودی بیش از ۲۷۲٬۰۰۰ توکن، نرخ ورودی و حافظه نهان برای کل درخواست دو برابر و نرخ خروجی ۱٫۵ برابر میشود.
یک محاسبه فرضی ساده: ۱۰۰٬۰۰۰ توکن ورودی بدون حافظه نهان و ۱۰٬۰۰۰ توکن خروجی قابلصورتحساب، با نرخ استاندارد ۱٫۵۰ دلار هزینه دارد. برای ۳۰۰٬۰۰۰ توکن ورودی و همان مقدار خروجی، ضرایب زمینه بلند هزینه را به ۶٫۷۵ دلار میرسانند. این مثالها هزینه ابزار، نوشتن حافظه نهان، تلاش دوباره و سایر خدمات را شامل نمیشوند؛ محاسبه عددی هستند، نه میانگین اندازهگیریشده هزینه یک کار.
بودجه را بر اساس خروجی پذیرفتهشده ببندید. تلاشهای شکستخورده و زمان بازبین را نیز حساب کنید و شرایط حافظه نهان را ثبت کنید. صورتحساب پایین وقتی خروجی به اصلاح فراوان نیاز دارد گمراهکننده است. در مقابل، نرخ بالاتر ممکن است با کاهش تعداد تلاشها اقتصادی باشد. هیچیک از این دو نتیجه فقط از روی فهرست قیمت مشخص نمیشود.
راهنمای استرا فراخوانی ناهمگام ابزار و دریافت اصلاحات میان اجرا را معرفی میکند. فراخوانی ابزار به Responses نیاز دارد. در مهاجرت باید پارامترهای پشتیبانینشده مانند temperature و top_p حذف شوند؛ تلاش استدلالی none نیز پشتیبانی نمیشود. تغییر تلاش میتواند با configuration_update و حفظ پیشوند درخواست انجام شود.
اجرای ناهمگام را مسئله مدیریت وابستگیها بدانید. وقتی ساخت سند هنوز ادامه دارد، عامل میتواند منبع مستقلی را بررسی کند، اما نمیتواند اعلام کند فایل نهایی بررسی شده است. برنامه شما باید شناسه فراخوانیها را نگه دارد، نتیجههای در انتظار را دنبال کند و پس از اتصال دوباره از اجرای تکراری اثرهای جانبی جلوگیری کند. اینها توصیه مهندسی برای استفاده از قابلیت هستند، نه وعده اینکه مدل صف کار شما را خودکار مدیریت میکند.
رسیدن نتیجه دیرهنگام پس از اصلاح کاربر را آزمایش کنید. اگر کاربر بازه زمانی را تغییر داد، نتیجه پرسوجوی قبلی نباید صرفاً چون دیرتر رسیده، پاسخ نهایی شود. ارتباط میان نسخه درخواست، ورودی ابزار و نتیجه پذیرفتهشده باید در وضعیت برنامه روشن و قابلبررسی باشد.
نتیجه آزمون علمی، استرا را نامزد مناسبی برای یک آزمایش پژوهشی اجرایی میکند. مسئلهای با ورودی مشخص، محیط مستند و بازبین آشنا با روش انتخاب کنید. فایل محاسباتی یا برنامه، نسخه وابستگیها، بررسیهای میانی و تفکیک مشاهده از فرضیه را بخواهید.
برای مثال، مدلی که دو گروه آزمایشی را مقایسه میکند باید پیش از نتیجهگیری، حذف دادهها، مقدارهای گمشده و واحد تحلیل را توضیح دهد. از بازبین بخواهید محاسبه را در محیطی پاک دوباره اجرا کند. توضیح متقاعدکننده بدون خروجی بازتولیدپذیر نباید همان امتیاز نتیجهای را بگیرد که اجرای مستقل آن موفق است.
این مقاله هیچ کشف علمی یا کاربرد بالینی را اعتبارسنجی نمیکند. پرسش محدودتر است: آیا دستیار زمان رسیدن به خروجی پژوهشی قابلبازبینی را کاهش میدهد، بدون اینکه استاندارد شواهد ضعیف شود؟ همین را مستقیماً اندازه بگیرید؛ نزدیک شدن به سقف یک آزمون، اثبات حل مسائل پژوهشی ناآشنا نیست.
مرور ایمنی OpenAI توان سایبری استرا را در آستانه بحرانی چارچوب خود طبقهبندی میکند و حفاظتهای قویتر را توضیح میدهد. همچنین از مقاومت بهتر در برابر تزریق دستور و چالشهای نظارت سخن میگوید. کارت سامانه شرح تفصیلی ارزیابیها را ارائه میکند؛ اینها ارزیابی عرضهکننده هستند، نه گواهی مستقل ایمنی.
در استقرار، مجوز انجام کار را بیرون از متن متقاعدکننده مدل نگه دارید. سندی که از دستیار میخواهد سطح دسترسی را تغییر دهد، محتوایی برای تفسیر است و دستور تازه کاربر نیست. رد شدن مجوز باید به توقف روشن یا گزینه مجاز دیگری منجر شود و اطلاعات کافی برای بازبینی باقی بماند.
کارهای متوقفشده و ردشده را هم در آزمایش بگنجانید. وقتی کار در محدوده مجاز تکمیل نمیشود، توضیح درست پیشنیاز برآوردهنشده باید نتیجه صحیح محسوب شود. در غیر این صورت، ارزیابی ممکن است ناخواسته به ادعای بیپشتوانه موفقیت یا میانبر غیرمجاز پاداش بدهد. سیاست پذیرش باید مجوزهای واقعی کسبوکار، از جمله اقداماتی که کاربر قبلاً مجاز کرده، را منعکس کند.
بررسی Fable 5.1 و Mythos 5.1 عرضه نزدیک به استرا را پوشش میدهد. از آن برای شناسایی پرسشهای مهاجرت استفاده کنید و سپس سامانههای فعلی را روی مجموعه کار یکسان مقایسه کنید. اعداد ارزیابی عرضهکنندگان مختلف را طوری ترکیب نکنید که گویی ابزار، حفاظت، زمان و روش نمرهدهی یکسان بودهاند.
مقایسه مناسب شامل کار ساده، کار دشوار اما حلشدنی و درخواست عمداً ناقص است. پیش از اجرا، داده ورودی و معیار پذیرش را ثابت کنید. شناسه مدل، تلاش، نسخه برنامه، مجوز ابزار، هزینه، زمان و مداخله انسانی را کنار هر نتیجه نگه دارید. در صورت امکان، بازبین نام مدل را نبیند تا هیجان معرفی محصول بر نمرهدهی اثر نگذارد.
با مجموعه کوچکی از کارهای تکراری شروع کنید که خروجی درست آنها قابلبررسی است. عملکرد مسیر فعلی را ثبت کنید، سپس استرا را در شرایط مشابه اجرا کنید. دقت واقعی، قابلیت استفاده از خروجی، رعایت مجوز و نرخ تکمیل را جدا بسنجید و همه را به یک نمره سلیقهای تقلیل ندهید.
تنها جایی استفاده را گسترش دهید که فایده پس از بازبینی باقی میماند. مسیر قبلی را نگه دارید و شرط بازگشت مشخص کنید؛ مثلاً افزایش ادعاهای بیپشتوانه یا خرابی تکراری سند. پیش از استفاده گسترده، ورودی بلند، نشست قطعشده، ابزار در دسترسنبوده و اطلاعات ناقص کاربر را بیازمایید. محدودیتها را کنار مثالهای موفق ثبت کنید تا همکاران بدانند شواهد آزمایش تا کجا اعتبار دارند.
پیشنهاد ما ارزیابی استرا ابتدا روی کارهای پرهزینه و چندمرحلهای با معیار پذیرش روشن است. معرفی محصول برای توجیه چنین آزمایشی شواهد جذابی دارد؛ تصمیم جایگزینی مسیر موجود باید بر خروجی پذیرفتهشده، هزینه اندازهگیریشده و محدودیتهای عملیاتی خود شما متکی باشد.
بازبینی در ۵ سپتامبر ۲۰۲۶ انجام شد. تاریخ انتشار بالا مربوط به این مقاله است؛ معرفی مدل در ۳ سپتامبر بود. نتایج آزمون به عرضهکننده نسبت داده شدهاند. مثالها و پیشنهادهای پذیرش، تحلیل تحریریه ژرف هستند و برای این مقاله آزمایش مستقل مدل انجام نشده است.

دیپسیک در ۱۰ سپتامبر مدل تازه خود را با بینایی بومی و هزینه کمتر معرفی کرد؛ بررسی نتایج، قیمت API و تغییر مهم مسیر درخواستها در ۱۴ سپتامبر.
ادامه مطلب
خانواده ۱۸ تیر OpenAI مدل پرچمدار، متعادل و اقتصادی را با معیارهای پیشرو ترمینال، کد، مرور و علم و یک رده چندعاملی عرضه میکند.
ادامه مطلب
انتشار ۱۰ شهریور آنتروپیک کار عامل و پژوهش علمی را تقویت میکند، قیمت خواندن کش را ۷۵ درصد کاهش میدهد و قرارداد نگهداری استدلال را تغییر میدهد.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.