
Claude Sonnet 5؛ عامل نزدیک Opus با اقتصاد Sonnet
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلبپژوهش ژرف
میز انتشار مدل

آنتروپیک در ۱ سپتامبر ۲۰۲۶، برابر با ۱۰ شهریور ۱۴۰۵ Claude Fable 5.1 و Claude Mythos 5.1 را منتشر کرد. مرور رسمی مدل Fable 5.1 را مسیر عمومی برای استدلال دشوار و کار عامل بلندمدت معرفی میکند. Mythos 5.1 همان توان زیرین را فقط در اختیار اعضای تأییدشده Project Glasswing میگذارد و برای کار مجاز امنیت سایبری و علوم زیستی حفاظت متفاوتی دارد.
روشنترین جهش در کار علمی قابل اجراست. Fable 5.1 در Terminal-Bench-Science 0.1 به ۵۲٫۶ درصد میرسد؛ نتیجه Fable 5 برابر ۲۴٫۷ و Opus 5 برابر ۲۹٫۰ درصد در اجرای آنتروپیک است. مدل در Terminal-Bench 4.0 امتیاز ۵۵٫۸، در CursorBench 3.2.0 امتیاز ۷۳٫۴ و در AutomationBench امتیاز ۳۱٫۴ دارد. قیمت پایه ورودی و خروجی همان ۱۰ و ۵۰ دلار برای هر یک میلیون توکن مانده، اما خواندن کش به ۰٫۲۵ دلار رسیده است؛ یعنی ۷۵ درصد کمتر از Fable 5.
جدول خلاصه توان از کارت سیستم رسمی Claude Fable 5.1 و Mythos 5.1 آنتروپیک.
رسانه دستاول: جدول 8.1.A از کارت سیستم Fable 5.1 و Mythos 5.1 آنتروپیک. جدول فروشنده مدرک اجرای انتشار است، نه رتبهبندی مستقل یا تضمین نتیجه در پوسته دیگر.
Fable 5.1 با شناسه claude-fable-5-1 در رابط Claude، آمازون Bedrock، گوگل Cloud، مایکروسافت Foundry و Claude Platform on AWS فعال است. متن و تصویر میگیرد، متن برمیگرداند، پنجره زمینه یک میلیون توکنی و حداکثر خروجی ۱۲۸ هزار توکنی دارد. adaptive thinking همیشه فعال و تلاش پیشفرض high است. آنتروپیک ژوئن ۲۰۲۶ را مرز دانش قابل اتکا و داده آموزش اعلام میکند.
Mythos 5.1 شناسه claude-mythos-5-1 دارد و سطح ثبتنام عمومی نیست. مشتری تأییدشده Glasswing از طریق آنتروپیک و بعضی شریکهای ابری به آن میرسد. طبق مستند، دو نام مشخصات، توان و قیمت مشترک دارند؛ رفتار مؤثر آنها در درخواستهایی که حفاظت عمومی Fable مداخله میکند یکسان نیست.
این پیوستگی برای خواننده تحلیل انتشار Fable 5 و Mythos 5 مهم است. نسخه ۵٫۱ معماری «یک مدل، دو مرز دسترسی» را حذف نمیکند؛ همان معماری را ارتقا میدهد و چند قرارداد رابط را عوض میکند.
Terminal-Bench-Science 0.1 شامل ۷۰ وظیفه عامل از علوم زیستی، فیزیکی، زمین، ریاضی و مهندسی است. عامل دستور زبان طبیعی میگیرد، در محیط بسته کار میکند و artifact نهایی با آزمون پنهان سنجیده میشود. آنتروپیک برای Fable 5.1 ده اجرا در هر وظیفه، در مجموع ۷۰۰ آزمایش، با Claude Code در حالت bare و تلاش حداکثری گزارش میکند.
امتیاز ۵۲٫۶ بیش از دو برابر ۲۴٫۷ نسخه قبل است. خطای استاندارد حدود ۳٫۵ تا ۴٫۵ واحد درصد گزارش میشود، زیرا بسیاری از وظیفهها یا تقریباً همیشه حل میشوند یا تقریباً هیچوقت. اندازه اختلاف از نوسان عادی بزرگتر است، ولی نباید آن را «حل ۵۲٫۶ درصد علم» ترجمه کرد. معیار مجموعهای مشخص از گردشکار پژوهشی قابل اجرا را میسنجد.
این نتیجه قویترین علامت محصول است: مدل بهتر میتواند بررسی محیط، محاسبه، ساخت خروجی و اعتبارسنجی را در یک زنجیره نگه دارد. آزمایشگاه یا تیم مهندسی هنوز باید وظیفه بومی با داده منجمد، آزمون اجرایی، تبار منبع و بازبین متخصص بسازد.
در Terminal-Bench 4.0، Mythos 5.1 امتیاز ۶۰٫۹ و Fable 5.1 امتیاز ۵۵٫۸ میگیرند؛ Opus 5 برابر ۵۲٫۳ و Fable 5 برابر ۴۲٫۰ است. اجرای آنتروپیک با Claude Code bare و تلاش حداکثری انجام شده است. تعداد تکرار برابر نیست: Mythos برای هر وظیفه ده بار و سه مدل دیگر پانزده بار اجرا شدهاند. خطای استاندارد حدود ۱٫۶ تا ۲ واحد درصد است.
Cursor نیز Fable 5.1 را در پوسته عامل تولیدی خود سنجیده است. مدل با تلاش حداکثری در CursorBench 3.2.0 امتیاز ۷۳٫۴ گرفته؛ ۲٫۹ واحد بالاتر از Fable 5 و با کمی بیش از نصف هزینه هر وظیفه در همان ارزیابی. در تلاش medium، امتیاز ۶۸٫۰ با هزینه ۳٫۵۳ دلار برای هر وظیفه گزارش میشود. همراهی کیفیت و هزینه مفید است، ولی توزیع کار و پوسته Cursor خصوصیاند.
SWE-bench Pro حرکت کوچکتری دارد: از ۸۰٫۰ برای Fable 5 به ۸۱٫۲ برای خانواده ۵٫۱. نتیجه چندزبانه ۸۹٫۱ است و کمی پایینتر از ۸۹٫۵ Opus 5 میماند. نتیجه چندوجهی ۵۴٫۷ است، در برابر ۵۹٫۴ Opus 5. معتبرترین خوانش جدول این است که Fable 5.1 در همه ردیفها برنده نیست.
آنتروپیک بر سند، صفحه گسترده، اسلاید، پژوهش چندمرحلهای، خواندن PDF متراکم، زمینه بلند و استفاده از رایانه تأکید دارد. در کارت سیستم، GDPval-AA v2 از ۱٬۷۲۳ برای Fable 5 به ۱٬۸۵۳ برای Fable 5.1 میرسد و AA-Briefcase از ۱٬۵۷۲ به ۱٬۶۹۴ میرود. OSWorld 2.0 در سنجه partial برابر ۷۷٫۹ و در سنجه strict برابر ۴۱٫۷ است.
AutomationBench ادعای عامل کسبوکار را دقیق میکند. عامل در شرکت شبیهسازیشده با ۴۷ برنامه، سندهای سیاست چندلایه، عامل حواسپرتی و دهها عمل API وابسته کار میکند. Fable 5.1 امتیاز ۳۱٫۴ دارد؛ Fable 5 برابر ۱۷٫۱ و Opus 5 برابر ۲۶٫۹ است. پیشرفت مهم است و همزمان نشان میدهد بیشتر گردشکارها زیر قرارداد سخت قبول یا رد هنوز شکست میخورند.
در پذیرش تولید، مکالمه روان معیار نباشد؛ artifact نهایی را بسنجید. صفحه گسترده باید فرمول، منبع و کنترل تطبیق را حفظ کند. اسلاید به ادعای دقیق و چیدمان قابل استفاده نیاز دارد. تغییر کد باید آزمون، محدوده قابل بازبینی و commit شناختهشده داشته باشد. راهنمای ارزیابی مدل مرزی چهارچوب پذیرش کل سامانه را فراتر از درصد فروشنده ارائه میکند.
قیمت پایه ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای خروجی است. نوشتن کش پنجدقیقهای ۱۲٫۵۰ دلار، نوشتن یکساعته ۲۰ دلار و پردازش batch دارای ۵۰ درصد تخفیف ورودی و خروجی است. تغییر مهم خواندن کش است: ۰٫۲۵ دلار برای هر یک میلیون توکن؛ یکچهارم نرخ Fable 5 و ۲٫۵ درصد قیمت ورودی پایه.
این تخفیف برای کاری مهم است که پیشوند بلند و ثابت را بارها میخواند: نقشه مخزن، بسته سیاست، پیکره پژوهش یا تاریخ عامل. معنی آن ارزانشدن ۷۵ درصدی همه تماسها نیست. ورودی تازه، نوشتن کش، خروجی، ابزار، retry و بازبینی انسان همچنان هزینه دارند. هزینه را برای وظیفه پذیرفتهشده و با نرخ hit واقعی حساب کنید، نه با زمینه آرمانی.
توکنایزر با Fable 5 یکسان است. آنتروپیک هشدار میدهد متن مشابه نسبت به مدلهای قدیمیتر از Opus 4.7 حدود ۳۰ درصد توکن بیشتر میسازد. مهاجرت از نسل قدیمی باید بر شمارش واقعی توکن استوار باشد، نه طول نویسه.
راهنمای رسمی تغییرات ۵٫۱ سه رفتار شکننده را نام میبرد.
نخست، اجبار ابزار پشتیبانی نمیشود. tool_choice با نوع any یا ابزار نامبرده خطای ۴۰۰ از نوع invalid_request_error میدهد. انتخاب خودکار ابزار را با schema سخت یا structured output ترکیب و در prompt روشن کنید ابزار چه زمانی لازم است.
دوم، مدلهای قدیمیتر Claude نمیتوانند thinking block ساختهشده توسط Fable 5.1 را بخوانند. Fable 5.1 استدلال نسل قبل را میخواند، اما مسیریاب هنگام برگشت از ۵٫۱ به Opus 5، Fable 5 یا مدل قدیمیتر آن بلوکها را برای turn مقصد از دست میدهد. رابط میتواند بلوک ناسازگار را حذف کند و بابت آن توکن نگیرد، ولی مدل مقصد آن زمینه استدلال را ندارد.
سوم، ویرایش هر چیز پیش از thinking block میتواند آن را به مکالمه متفاوت مقید کند و خطا بسازد. بازسازی system prompt، تغییر آرایه ابزار، ویرایش turn قدیمی یا ارائه byte متفاوت از یک URL فایل، استدلال بعدی را نامعتبر میکند. تاریخ تولید باید append-only باشد؛ دستور و تغییر ابزار با پیام میانمکالمهای و فشردهسازی با مسیر پشتیبانیشده سرور انجام شود.
Fable 5.1 در حالت beta تلاش هر پیام را تغییر میدهد؛ عامل میتواند برای گام دشوار effort را بالا و برای کار عادی پایین بیاورد، بدون اینکه cache prompt نامعتبر شود. پیام سیستمی turn-scoped یادآوری پرقدرت را برای یک turn اعمال میکند و در تاریخ تغییرناپذیر میماند. گزینه تازه thinking.display: "updates" نیز پیام پیشرفت کوتاه میان ابزارها را بدون نمایش زنجیره خصوصی استدلال میفرستد.
اینها قابلیت عملیاتیاند، نه تزئین benchmark. کار طولانی پیشرفت قابل دیدن میخواهد، ولی پیام پیشرفت مدرک تکمیل نیست. راهنمای prompt ویژه Fable 5.1 همچنین میگوید فراخوانی موازی ابزار متغیرتر شده، اجرای effort بالا ممکن است گزارش میانی کمتری بدهد، effort پایین کمتر جستوجو کند و ویرایش کوچک فایل به بازنویسی کامل تبدیل شود. پوسته و telemetry باید این رفتارها را مستقیم بسنجند.
تبار محتوا نیز به قرارداد خروجی آمده است. آنتروپیک میگوید متن Fable 5.1 و Mythos 5.1 در سطحهای پشتیبانیشده watermark آماری دارد و فایل تصویر یا ویدیوی پشتیبانیشده که از Files API بازیابی شود میتواند Content Credentials امضاشده C2PA بگیرد. provenance به تشخیص منشأ کمک میکند، اما صحت ادعا یا امنیت کد را ثابت نمیکند.
کارت سیستم میگوید حفاظت سایبری Fable 5.1 همان دستههای پرخطر Fable 5 را پوشش میدهد، ولی کشف آسیبپذیری در کد منبع را برای دسترسی عمومی اجازه و کشف در binary کامپایلشده را مسدود میکند. classifier تازه کار دفاعی را بهطور معنادار کمتر از حفاظت آغاز Fable 5 مسدود میکند، هرچند هنوز از Opus 5 بیشتر فعال میشود.
Mythos 5.1 برای کار تأییدشده سایبری و علوم زیستی محدود است. دسترسی ویژه، نتیجه مدل را به مجوز exploit، آزمایش یا ارسال داده حساس تبدیل نمیکند. محدوده، sandbox، بازبین متخصص و دروازه تأیید همچنان مسئولیت بیرون مدلاند.
هر دو مدل نگهداری ۳۰ روزه داده دارند و مگر با مجوز صریح آنتروپیک تحت zero data retention عرضه نمیشوند. این شرط برای کار تنظیمشده، محرمانه یا منتشرنشده تعیینکننده است. طبقهبندی داده و بازبینی قرارداد باید پیش از بارگذاری مجموعه ارزیابی انجام شود.
مجموعه replayable را در چهار مسیر بسازید: مهندسی مخزن، پژوهش با artifact اجرایی، سند اداری و عمل رایانه یا API. شناسه دقیق مدل، effort، نسخه پوسته، وضعیت کش، مجوز ابزار، fallback ایمنی، زمان دیواری، هزینه توکن، دخالت انسان و نتیجه پذیرش ثبت شود.
شکست مهاجرت را عمداً اجرا کنید. ابزار اجباری بفرستید و خطای ۴۰۰ مورد انتظار را ببینید. مکالمه را از Fable 5.1 به مدل قدیمیتر مسیریابی و رفتار thinking block را ثبت کنید. turn قدیمی را در تاریخ آزمایشی تغییر دهید و سیاست mismatch را بسنجید. cache miss را کنار hit آرمانی آزمایش کنید.
عمل مادی پشت تأیید جدا بماند: merge، deploy، ارسال، خرید، تغییر مجوز، API مخرب و اجرای آزمایشگاهی. مدلی که کار بلند را بهتر ادامه میدهد پیش از دیدهشدن فرض غلط مسافت بیشتری میرود. تکمیل قویتر، دروازه شاهد را مهمتر میکند.
Claude Fable 5.1 ارتقای واقعی کار بلندمدت است. شاهد قانعکننده افزایش کوچک SWE-bench Pro نیست؛ ترکیب دو برابرشدن امتیاز ترمینال علمی، پیشرفت ترمینال و عامل کسبوکار، منحنی بهتر کیفیت و هزینه در پوسته Cursor و قیمت کش مناسب زمینه تکراری است.
مهاجرت فقط تغییر نام مدل نیست. ابزار اجباری، سازگاری بلوک استدلال، تاریخ تغییرناپذیر، مشاهده پیشرفت، حفاظت و نگهداری داده روی سامانه مستقر اثر دارند. Fable 5.1 مسیر عمومی سختترین کار عادی و Mythos 5.1 مسیر محدود حوزه حساس تأییدشده است. آنها را دو سامانه مؤثر با یک پایه توان مشترک ارزیابی کنید.

مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلب
پرچمدار ۷ خرداد آنتروپیک کار مخزن، عامل بلندمدت، استفاده از رایانه و استدلال بصری را ارتقا میدهد و کارت سیستم محدودیتها را آشکار میکند.
ادامه مطلب
دیپسیک در ۱۰ سپتامبر مدل تازه خود را با بینایی بومی و هزینه کمتر معرفی کرد؛ بررسی نتایج، قیمت API و تغییر مهم مسیر درخواستها در ۱۴ سپتامبر.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.