
معرفی GPT-6 Astra؛ قابلیتها، قیمت و تغییرات مهم
استرا با پیشرفت در کار علمی و استفاده از رایانه، قابلیتهای تازه برای عاملها و قیمت بالاتر معرفی شد؛ بررسی شواهد و راهنمای عملی ارزیابی این مدل.
ادامه مطلبپژوهش ژرف
تحریریه معرفی مدلها

دیپسیک مدل V4.1 Flash را در ۱۰ سپتامبر ۲۰۲۶ معرفی کرد. این مدل درک بومی تصویر را با معماری تازهای ترکیب میکند که هدفش کاهش هزینه عاملهای طولانیمدت است. برای توسعهدهندگانی که همین حالا از دیپسیک استفاده میکنند، خبر فقط عرضه یک گزینه تازه نیست: ممکن است نام مدل در برنامه ثابت بماند، اما مدلی که درخواست را پاسخ میدهد عوض شود.
اعلام رسمی عرضه دسترسی از طریق رابط برنامهنویسی مستقیم با شناسه deepseek-flash را تأیید میکند. این مقاله برای مدیران فنی، توسعهدهندگان برنامه و گروههایی نوشته شده که برای پردازش سند یا برنامهنویسی مدل انتخاب میکنند. خبر دسترسی، اعلام عرضهکننده است؛ ما درخواست پولی اجرا نکردهایم و دسترسی حسابهای مختلف را بررسی نکردهایم. در تحلیل جداگانه معماری، معادلهها، ساختار حافظه نهان و پیادهسازی مرجع را دقیقتر بررسی میکنیم.
تصویر جلد: تصویرسازی تحریریه با کمک هوش مصنوعی درباره محاسبه نامتقارن و حافظه فشرده. نمودارهای داخل مقاله تصاویر اصلی دیپسیک هستند و جداگانه اعتباردهی شدهاند.
پرسش کاربردی این است که آیا عامل میتواند کاری را با پردازش تکراری کمتر تمام کند. دستیار برنامهنویسی ممکن است مخزن را بخواند، گزارش بلند آزمون را دریافت کند، تصویری از رابط را ببیند و پس از هر فراخوانی ابزار دوباره به همان زمینه مراجعه کند. حتی وقتی پاسخ نهایی کوتاه است، پردازش ورودی و نگهداری وضعیت گفتوگو میتواند بخش بزرگی از هزینه را بسازد.
مدل تازه این الگو را هدف گرفته است. نگهداری مخزن نرمافزاری، اصلاح رابط با کمک تصویر صفحه و مقایسه اسناد، نمونههای مناسبی برای ارزیابی هستند. این موضوع به معنی نیاز همه کارهای استخراج اطلاعات به عامل استدلالی نیست. هر جا تجزیه قطعی داده و محاسبه مستقیم نتیجه قابلاعتماد میدهد، آن مسیر را حفظ کنید و مدل را در نقطهای بسنجید که تفسیر لازم است.
پوشش قبلی خانواده DeepSeek V4 عرضه ماه آوریل را ثبت کرده است. رویداد سپتامبر، معماری و تغییر خدمترسانی تازهای دارد و نباید تاریخ معرفی خانواده قبلی را با آن جابهجا کرد.
دیپسیک میگوید مدلهای اصلی پشت deepseek-v4-flash و deepseek-v4-flash-vision-exp بازنشسته شدهاند و این نامها اکنون به V4.1 Flash میرسند. همچنین قرار است همه درخواستهای deepseek-v4-pro از ۱۴ سپتامبر، ساعت ۰۴:۰۰ UTC با مدل جدید و قیمت Flash پاسخ داده شوند؛ یعنی ساعت ۰۷:۳۰ تهران. این وضعیت تا عرضه V4.1 Pro ادامه دارد، اما اطلاعیه تاریخی برای عرضه آن تعیین نکرده است.
بنابراین ثابت ماندن شناسه، تضمین ثابت ماندن نسخه نیست. این تغییر را در سابقه ارزیابی ثبت کنید؛ بهویژه اگر داشبورد شما نتایج را فقط با برچسب «V4 Pro» نگه میدارد. تغییر پنهان مدل میتواند سبک پاسخ، مصرف توکن، آرگومان ابزار و الگوی خطا را عوض کند، بدون آنکه نسخه تازهای از برنامه خودتان منتشر شده باشد.
پیش از موعد، از خدمت فعلی خط مبنا بگیرید و کارهای نماینده را روی مسیر جدید تکرار کنید. پس از تغییر مسیر، شناسه بازنشسته Pro گزینه بازگشت به مدل قبلی نخواهد بود. جایگزینی انتخاب کنید که مستقل از این نام در دسترس باشد و پیش از تکیه بر آن، دسترسیاش را بررسی کنید.
کارت مدل میان ۵۵۲ میلیارد پارامتر بدنه اصلی و ۱۹۶ میلیارد پارامتر حافظه شرطی Engram تفاوت میگذارد. معماری رمزگذار–رمزگشای علّی هنگام پیشپرکردن حدود ۸ میلیارد و هنگام تولید حدود ۱۶ میلیارد پارامتر را فعال میکند. اشتراک میان لایهها و ذخیره کمدقت، حافظه نهان سراسری KV را به ۸۹۰ بایت برای هر توکن میرساند. گزارش، اندازه آن را حدود یکچهارم حافظه سراسری Flash قبلی و اندازه حافظه نهان پایدار را حدود یکهشتم آن توصیف میکند.
این اعداد یک چیز را اندازه نمیگیرند. پارامتر فعال به مسیر محاسبه مربوط است، اما وزنهای ذخیرهشده، وضعیت موقت و حافظه نهان منابع استقرار را تعیین میکنند. «۸ میلیارد فعال» به معنی یک مدل دانلودی ۸ میلیاردپارامتری نیست. کاهش KV نیز به معنی یکچهارم شدن کل حافظه گرافیکی خدمت نیست. پیش از خرید سختافزار یا وعده زمان پاسخ مشخص، باید این تفاوتها روشن باشند.
جدول زیر گزیده نتایج اعلامشده دیپسیک برای مدل آموزشدیده با حداکثر تلاش استدلالی است و آزمون ژرف محسوب نمیشود. دیپسیک برای کارهای مختلف از چارچوبهای اجرایی متفاوت استفاده کرده؛ درصدها به همان تنظیمات مربوطاند.
| ارزیابی | V4.1 Flash | V4 Pro | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | ۹۰٫۶ | ۸۷٫۹ | ۸۹٫۱ | ۸۸٫۸ |
| DeepSWE v1.1 | ۷۴٫۲ | ۶۲٫۷ | ۷۴٫۰ | ۷۳٫۰ |
| AutomationBench | ۵۴٫۸ | ۴۳٫۲ | ۵۰٫۳ | ۴۵٫۸ |
| Terminal-Bench 4.0 | ۳۱٫۲ | ۱۲٫۴ | ۵۱٫۸ | ۳۹٫۹ |
| GPQA Diamond | ۹۰٫۹ | ۹۲٫۴ | ۹۳٫۴ | ۹۴٫۱ |
نمودار اصلی دیپسیک برای ارزیابی عاملها؛ مقایسه Terminal-Bench 3.0 نیز فاصله با Opus 5 و GPT-5.6 Sol را نشان میدهد. این شواهد عرضهکننده است، نه آزمون مستقل.
دو ردیف آخر اجازه نمیدهند نتیجه بگیریم مدل در همه کارها بهترین است. خدمت نگهداری کد روزمره و عامل پژوهشی برای مسئله علمی تخصصی به شواهد متفاوتی نیاز دارند. میانگین گرفتن از درصدهای نامرتبط، نرخ موفقیت واقعی در محیط کار نمیسازد.
برای آزمایش منصفانه، ورودی کار، مجوز ابزار، سقف زمان و معیار پذیرش را ثابت کنید. تغییرات ردشده و زمان اصلاح انسانی را هم کنار نمونههای موفق بشمارید. ممکن است مدل خیلی زود پاسخی ظاهراً مناسب بسازد، اما اگر بازبین مرتب آن را اصلاح کند، زمان رسیدن به خروجی پذیرفتهشده همچنان بیشتر باشد.
صفحه رسمی قیمت نرخهای زیر را به دلار آمریکا برای هر یک میلیون توکن اعلام میکند. این ارقام در ۱۱ سپتامبر بررسی شدهاند. همان صفحه پنجره زمینه یکمیلیونتوکنی و سقف خروجی ۳۸۴ هزار توکن را مشخص میکند.
| نوع مصرف | ساعت کمبار | ساعت پربار |
|---|---|---|
| ورودی با اصابت حافظه نهان | ۰٫۰۰۳ دلار | ۰٫۰۰۶ دلار |
| ورودی بدون اصابت حافظه نهان | ۰٫۱۵ دلار | ۰٫۳۰ دلار |
| خروجی | ۰٫۶۰ دلار | ۱٫۲۰ دلار |
بازههای پربار، دوشنبه تا جمعه، ۰۱:۰۰ تا ۰۴:۰۰ و ۰۶:۰۰ تا ۱۰:۰۰ UTC هستند؛ همه ساعتهای دیگر کمبار محسوب میشوند. اینها نرخ رابط مستقیم دیپسیکاند و تضمینی درباره صورتحساب همه واسطهها نیستند.
یک مثال صرفاً حسابی: ۱۰۰ هزار توکن ورودی بدون اصابت و ۱۰ هزار توکن خروجی قابلصورتحساب، در ساعت کمبار ۰٫۰۲۱ دلار و در ساعت پربار ۰٫۰۴۲ دلار هزینه دارد. اگر همه همان توکنهای ورودی مشمول نرخ اصابت شوند، جمع به ۰٫۰۰۶۳ و ۰٫۰۱۲۶ دلار میرسد. هزینه واقعی عامل به خروجی استدلال، فراخوانیهای تکراری، تلاش مجدد و ابزارهای بیرونی هم بستگی دارد. این مثالها میانگین اندازهگیریشده هزینه کار نیستند.
زمانبندی کار منعطف در ساعت ارزانتر مفید است، ولی مهلت تحویل و بازیابی خطا را هم حساب کنید. صرفهجویی کسری از یک سنت وقتی دسته پردازش متوقفشده گزارش صبح را عقب میاندازد، ارزش عملی ندارد. سهم اصابت حافظه نهان و تعداد خروجی پذیرفتهشده را جدا ثبت کنید تا تغییر نوع کار، بهاشتباه پیشرفت مدل تلقی نشود.
مستندات بینایی دریافت تصویر درون درخواست، از نشانی قابلدسترسی یا با ارجاع به فایل بارگذاریشده را پشتیبانی میکند. تصویر به توکن ورودی قابلصورتحساب تبدیل میشود. گزینه جزئیات low تصویر را به ۵۱۲ در ۵۱۲ کاهش میدهد و ممکن است نوشته ریز از دست برود؛ تنظیمات دیگرِ پشتیبانیشده، تصویر اصلی را پیش از پردازش معمول خدمت حفظ میکنند.
برای آزمایش اسناد فارسی، هم اسکن واضح داشته باشید و هم نمونه دشوار: رقمهای فارسی و لاتین در کنار هم، جدول متراکم، مهر کمرنگ، صفحه چرخیده و تصویر رابط با برچسب راستبهچپ. متن اصلی فیلد، محل آن و مقدار نرمالشده را جدا بخواهید. رونویسی و تفسیر را جدا نمره بدهید. اینها پیشنهاد ارزیابیاند؛ شواهد عرضه، دقت تشخیص متن فارسی را ثابت نمیکند.
برای نمودار، اگر جدول داده اصلی موجود است، مقادیر استخراجشده را با آن تطبیق دهید. تشخیص درست رنگ میله با خواندن درست مقیاس و مخرج شاخص متفاوت است. از دستیار بخواهید شاهد ناخوانا را مشخص کند، نه اینکه برای کامل به نظر رسیدن خلاصه، عددی بسازد.
راهنمای حالت استدلال سطوح low، high و max را ارائه میکند؛ استدلال بهصورت پیشفرض روشن و سطح آن high است. در درخواستهای Chat Completions که ابزار دارند، مطابق راهنما فیلد برگشتی reasoning_content را در درخواستهای بعدی حفظ کنید. واسطی که فیلدها را حذف میکند ممکن است گفتوگو را خراب کند، حتی اگر درخواست ساده تکمرحلهای درست کار کند.
آزمایش را با سطح صریح آغاز کنید و آن را کنار نتیجه نگه دارید. امتیاز ارزیابی با حداکثر تلاش، پیشبینی عملکرد تنظیمات پیشفرض نیست. فراخوانی قطعشده، نتیجه ابزار با قالب خراب و اصلاح خواسته کاربر در میانه کار طولانی را نیز امتحان کنید. برنامه باید پاسخ را به درخواست درست وصل کند و تلاش مجدد را اقدام مجاز دوم حساب نکند.
نشانی پایه خدمت مستقیم https://api.deepseek.com و نام مدل آن deepseek-flash است. اعلام عرضه در درگاه Vercel، به تاریخ ۹ سپتامبر، شناسه جداگانه deepseek/deepseek-v4.1-flash را معرفی میکند. تنظیمات عرضهکننده و سابقه هزینه را روشن نگه دارید؛ تاریخ زودتر این درگاه با اعلام رسمی ۱۰ سپتامبر دیپسیک یکی نیست.
وزنها با مجوز MIT عرضه شدهاند، اما راهنمای استنتاج حداقلی پیادهسازی را مرجعی خوانا توصیف میکند که موتور خدمترسانی تولیدی نیست. مسیر پیشروی DSpark در آن وجود دارد، ولی حلقه تولید از نمونهگیری خودرگرسیو معمولی استفاده میکند.
برای بیشتر گروههای ساخت برنامه، آزمایش API سریعترین راه بررسی کیفیت خروجی است. تصمیم میزبانی داخلی علاوه بر کیفیت، به فهرست وزنها، پشتیبانی قالب دقت، ظرفیت حافظه میزبان، اندازهگیری ارتباط میان دستگاهها و مسئول عملیاتی نیاز دارد. این نیازها را نمیتوان از نام «Flash» نتیجه گرفت. امکان دانلود وزن و امکان خدمترسانی اقتصادی دو پرسش متفاوتاند.
کارهایی را جلو بیندازید که ورودی بلند و قابلبازاستفاده و خروجی قابلبررسی دارند. پیش از تغییر مسیر Pro خط مبنای خدمت قبلی را ثبت کنید؛ سپس مدل تازه را با تلاش مشخص و ابزار یکسان اجرا کنید و هم نتیجه موفق و هم نتیجه ردشده را بررسی کنید. یک اجرای بدون حافظه نهان آماده و یک ادامه نشست را بگنجانید تا مقایسه هزینه به استفاده واقعی نزدیک باشد.
فقط جایی استفاده را گسترش دهید که فایده پس از بازبینی باقی میماند. ارزیابی تحریریه ما این است که V4.1 Flash برای عاملهای روزمره و کار دیداری روی برنامهها ارزش بررسی جدی دارد. ترکیب قیمت، کارایی ورودی و عملکرد اعلامشده عاملها دلیل اصلی آن است. تصمیم جایگزینی مسیر فعلی باید از خروجیهای پذیرفتهشده خودتان بیاید، نه از نام تازه روی اطلاعیه.
بازبینی در ۱۱ سپتامبر ۲۰۲۶؛ تاریخ معرفی مدل ۱۰ سپتامبر است. نتایج و ادعاهای خدمترسانی به عرضهکنندگان منتسباند. محاسبه هزینه و پیشنهاد ارزیابی، تحلیل تحریریه است و آزمون مستقل مدل اجرا نشده است.

استرا با پیشرفت در کار علمی و استفاده از رایانه، قابلیتهای تازه برای عاملها و قیمت بالاتر معرفی شد؛ بررسی شواهد و راهنمای عملی ارزیابی این مدل.
ادامه مطلب
خوانش فنی گزارش ۵۱صفحهای دیپسیک؛ اجرای رمزگذار–رمزگشای علّی، CSA2، بازپخش محدود، Engram، DSpark و تفاوت کد مرجع با سامانه تولیدی.
ادامه مطلب
انتشار ۱۰ شهریور آنتروپیک کار عامل و پژوهش علمی را تقویت میکند، قیمت خواندن کش را ۷۵ درصد کاهش میدهد و قرارداد نگهداری استدلال را تغییر میدهد.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.