Claude Fable 5.1 و Mythos 5.1؛ جهش عامل و پژوهش بلندمدت

پ

پژوهش ژرف

میز انتشار مدل

۱۰ شهریور ۱۴۰۵۱۰ دقیقه مطالعه
Claude Fable 5.1 و Mythos 5.1؛ جهش عامل و پژوهش بلندمدت

آنتروپیک در ۱ سپتامبر ۲۰۲۶، برابر با ۱۰ شهریور ۱۴۰۵ Claude Fable 5.1 و Claude Mythos 5.1 را منتشر کرد. مرور رسمی مدل Fable 5.1 را مسیر عمومی برای استدلال دشوار و کار عامل بلندمدت معرفی می‌کند. Mythos 5.1 همان توان زیرین را فقط در اختیار اعضای تأییدشده Project Glasswing می‌گذارد و برای کار مجاز امنیت سایبری و علوم زیستی حفاظت متفاوتی دارد.

روشن‌ترین جهش در کار علمی قابل اجراست. Fable 5.1 در Terminal-Bench-Science 0.1 به ۵۲٫۶ درصد می‌رسد؛ نتیجه Fable 5 برابر ۲۴٫۷ و Opus 5 برابر ۲۹٫۰ درصد در اجرای آنتروپیک است. مدل در Terminal-Bench 4.0 امتیاز ۵۵٫۸، در CursorBench 3.2.0 امتیاز ۷۳٫۴ و در AutomationBench امتیاز ۳۱٫۴ دارد. قیمت پایه ورودی و خروجی همان ۱۰ و ۵۰ دلار برای هر یک میلیون توکن مانده، اما خواندن کش به ۰٫۲۵ دلار رسیده است؛ یعنی ۷۵ درصد کمتر از Fable 5.

جدول خلاصه توان از کارت سیستم رسمی Claude Fable 5.1 و Mythos 5.1 آنتروپیک.جدول خلاصه توان از کارت سیستم رسمی Claude Fable 5.1 و Mythos 5.1 آنتروپیک.

رسانه دست‌اول: جدول 8.1.A از کارت سیستم Fable 5.1 و Mythos 5.1 آنتروپیک. جدول فروشنده مدرک اجرای انتشار است، نه رتبه‌بندی مستقل یا تضمین نتیجه در پوسته دیگر.

آنچه در ۱۰ شهریور عرضه شد

Fable 5.1 با شناسه claude-fable-5-1 در رابط Claude، آمازون Bedrock، گوگل Cloud، مایکروسافت Foundry و Claude Platform on AWS فعال است. متن و تصویر می‌گیرد، متن برمی‌گرداند، پنجره زمینه یک میلیون توکنی و حداکثر خروجی ۱۲۸ هزار توکنی دارد. adaptive thinking همیشه فعال و تلاش پیش‌فرض high است. آنتروپیک ژوئن ۲۰۲۶ را مرز دانش قابل اتکا و داده آموزش اعلام می‌کند.

Mythos 5.1 شناسه claude-mythos-5-1 دارد و سطح ثبت‌نام عمومی نیست. مشتری تأییدشده Glasswing از طریق آنتروپیک و بعضی شریک‌های ابری به آن می‌رسد. طبق مستند، دو نام مشخصات، توان و قیمت مشترک دارند؛ رفتار مؤثر آن‌ها در درخواست‌هایی که حفاظت عمومی Fable مداخله می‌کند یکسان نیست.

این پیوستگی برای خواننده تحلیل انتشار Fable 5 و Mythos 5 مهم است. نسخه ۵٫۱ معماری «یک مدل، دو مرز دسترسی» را حذف نمی‌کند؛ همان معماری را ارتقا می‌دهد و چند قرارداد رابط را عوض می‌کند.

جهش اصلی در ترمینال علمی است

Terminal-Bench-Science 0.1 شامل ۷۰ وظیفه عامل از علوم زیستی، فیزیکی، زمین، ریاضی و مهندسی است. عامل دستور زبان طبیعی می‌گیرد، در محیط بسته کار می‌کند و artifact نهایی با آزمون پنهان سنجیده می‌شود. آنتروپیک برای Fable 5.1 ده اجرا در هر وظیفه، در مجموع ۷۰۰ آزمایش، با Claude Code در حالت bare و تلاش حداکثری گزارش می‌کند.

امتیاز ۵۲٫۶ بیش از دو برابر ۲۴٫۷ نسخه قبل است. خطای استاندارد حدود ۳٫۵ تا ۴٫۵ واحد درصد گزارش می‌شود، زیرا بسیاری از وظیفه‌ها یا تقریباً همیشه حل می‌شوند یا تقریباً هیچ‌وقت. اندازه اختلاف از نوسان عادی بزرگ‌تر است، ولی نباید آن را «حل ۵۲٫۶ درصد علم» ترجمه کرد. معیار مجموعه‌ای مشخص از گردش‌کار پژوهشی قابل اجرا را می‌سنجد.

این نتیجه قوی‌ترین علامت محصول است: مدل بهتر می‌تواند بررسی محیط، محاسبه، ساخت خروجی و اعتبارسنجی را در یک زنجیره نگه دارد. آزمایشگاه یا تیم مهندسی هنوز باید وظیفه بومی با داده منجمد، آزمون اجرایی، تبار منبع و بازبین متخصص بسازد.

کدنویسی بهتر است، ولی پوسته بخشی از امتیاز می‌ماند

در Terminal-Bench 4.0، Mythos 5.1 امتیاز ۶۰٫۹ و Fable 5.1 امتیاز ۵۵٫۸ می‌گیرند؛ Opus 5 برابر ۵۲٫۳ و Fable 5 برابر ۴۲٫۰ است. اجرای آنتروپیک با Claude Code bare و تلاش حداکثری انجام شده است. تعداد تکرار برابر نیست: Mythos برای هر وظیفه ده بار و سه مدل دیگر پانزده بار اجرا شده‌اند. خطای استاندارد حدود ۱٫۶ تا ۲ واحد درصد است.

Cursor نیز Fable 5.1 را در پوسته عامل تولیدی خود سنجیده است. مدل با تلاش حداکثری در CursorBench 3.2.0 امتیاز ۷۳٫۴ گرفته؛ ۲٫۹ واحد بالاتر از Fable 5 و با کمی بیش از نصف هزینه هر وظیفه در همان ارزیابی. در تلاش medium، امتیاز ۶۸٫۰ با هزینه ۳٫۵۳ دلار برای هر وظیفه گزارش می‌شود. همراهی کیفیت و هزینه مفید است، ولی توزیع کار و پوسته Cursor خصوصی‌اند.

SWE-bench Pro حرکت کوچک‌تری دارد: از ۸۰٫۰ برای Fable 5 به ۸۱٫۲ برای خانواده ۵٫۱. نتیجه چندزبانه ۸۹٫۱ است و کمی پایین‌تر از ۸۹٫۵ Opus 5 می‌ماند. نتیجه چندوجهی ۵۴٫۷ است، در برابر ۵۹٫۴ Opus 5. معتبرترین خوانش جدول این است که Fable 5.1 در همه ردیف‌ها برنده نیست.

کار دانشی باید با artifact نهایی سنجیده شود

آنتروپیک بر سند، صفحه گسترده، اسلاید، پژوهش چندمرحله‌ای، خواندن PDF متراکم، زمینه بلند و استفاده از رایانه تأکید دارد. در کارت سیستم، GDPval-AA v2 از ۱٬۷۲۳ برای Fable 5 به ۱٬۸۵۳ برای Fable 5.1 می‌رسد و AA-Briefcase از ۱٬۵۷۲ به ۱٬۶۹۴ می‌رود. OSWorld 2.0 در سنجه partial برابر ۷۷٫۹ و در سنجه strict برابر ۴۱٫۷ است.

AutomationBench ادعای عامل کسب‌وکار را دقیق می‌کند. عامل در شرکت شبیه‌سازی‌شده با ۴۷ برنامه، سندهای سیاست چندلایه، عامل حواس‌پرتی و ده‌ها عمل API وابسته کار می‌کند. Fable 5.1 امتیاز ۳۱٫۴ دارد؛ Fable 5 برابر ۱۷٫۱ و Opus 5 برابر ۲۶٫۹ است. پیشرفت مهم است و هم‌زمان نشان می‌دهد بیشتر گردش‌کارها زیر قرارداد سخت قبول یا رد هنوز شکست می‌خورند.

در پذیرش تولید، مکالمه روان معیار نباشد؛ artifact نهایی را بسنجید. صفحه گسترده باید فرمول، منبع و کنترل تطبیق را حفظ کند. اسلاید به ادعای دقیق و چیدمان قابل استفاده نیاز دارد. تغییر کد باید آزمون، محدوده قابل بازبینی و commit شناخته‌شده داشته باشد. راهنمای ارزیابی مدل مرزی چهارچوب پذیرش کل سامانه را فراتر از درصد فروشنده ارائه می‌کند.

اقتصاد کش برای عامل بلند تغییر می‌کند

قیمت پایه ۱۰ دلار برای هر یک میلیون توکن ورودی و ۵۰ دلار برای خروجی است. نوشتن کش پنج‌دقیقه‌ای ۱۲٫۵۰ دلار، نوشتن یک‌ساعته ۲۰ دلار و پردازش batch دارای ۵۰ درصد تخفیف ورودی و خروجی است. تغییر مهم خواندن کش است: ۰٫۲۵ دلار برای هر یک میلیون توکن؛ یک‌چهارم نرخ Fable 5 و ۲٫۵ درصد قیمت ورودی پایه.

این تخفیف برای کاری مهم است که پیشوند بلند و ثابت را بارها می‌خواند: نقشه مخزن، بسته سیاست، پیکره پژوهش یا تاریخ عامل. معنی آن ارزان‌شدن ۷۵ درصدی همه تماس‌ها نیست. ورودی تازه، نوشتن کش، خروجی، ابزار، retry و بازبینی انسان همچنان هزینه دارند. هزینه را برای وظیفه پذیرفته‌شده و با نرخ hit واقعی حساب کنید، نه با زمینه آرمانی.

توکنایزر با Fable 5 یکسان است. آنتروپیک هشدار می‌دهد متن مشابه نسبت به مدل‌های قدیمی‌تر از Opus 4.7 حدود ۳۰ درصد توکن بیشتر می‌سازد. مهاجرت از نسل قدیمی باید بر شمارش واقعی توکن استوار باشد، نه طول نویسه.

سه تغییر شکننده نیازمند آزمون مهاجرت است

راهنمای رسمی تغییرات ۵٫۱ سه رفتار شکننده را نام می‌برد.

نخست، اجبار ابزار پشتیبانی نمی‌شود. tool_choice با نوع any یا ابزار نام‌برده خطای ۴۰۰ از نوع invalid_request_error می‌دهد. انتخاب خودکار ابزار را با schema سخت یا structured output ترکیب و در prompt روشن کنید ابزار چه زمانی لازم است.

دوم، مدل‌های قدیمی‌تر Claude نمی‌توانند thinking block ساخته‌شده توسط Fable 5.1 را بخوانند. Fable 5.1 استدلال نسل قبل را می‌خواند، اما مسیریاب هنگام برگشت از ۵٫۱ به Opus 5، Fable 5 یا مدل قدیمی‌تر آن بلوک‌ها را برای turn مقصد از دست می‌دهد. رابط می‌تواند بلوک ناسازگار را حذف کند و بابت آن توکن نگیرد، ولی مدل مقصد آن زمینه استدلال را ندارد.

سوم، ویرایش هر چیز پیش از thinking block می‌تواند آن را به مکالمه متفاوت مقید کند و خطا بسازد. بازسازی system prompt، تغییر آرایه ابزار، ویرایش turn قدیمی یا ارائه byte متفاوت از یک URL فایل، استدلال بعدی را نامعتبر می‌کند. تاریخ تولید باید append-only باشد؛ دستور و تغییر ابزار با پیام میان‌مکالمه‌ای و فشرده‌سازی با مسیر پشتیبانی‌شده سرور انجام شود.

کنترل تازه، عامل طولانی را قابل مشاهده می‌کند

Fable 5.1 در حالت beta تلاش هر پیام را تغییر می‌دهد؛ عامل می‌تواند برای گام دشوار effort را بالا و برای کار عادی پایین بیاورد، بدون اینکه cache prompt نامعتبر شود. پیام سیستمی turn-scoped یادآوری پرقدرت را برای یک turn اعمال می‌کند و در تاریخ تغییرناپذیر می‌ماند. گزینه تازه thinking.display: "updates" نیز پیام پیشرفت کوتاه میان ابزارها را بدون نمایش زنجیره خصوصی استدلال می‌فرستد.

این‌ها قابلیت عملیاتی‌اند، نه تزئین benchmark. کار طولانی پیشرفت قابل دیدن می‌خواهد، ولی پیام پیشرفت مدرک تکمیل نیست. راهنمای prompt ویژه Fable 5.1 همچنین می‌گوید فراخوانی موازی ابزار متغیرتر شده، اجرای effort بالا ممکن است گزارش میانی کمتری بدهد، effort پایین کمتر جست‌وجو کند و ویرایش کوچک فایل به بازنویسی کامل تبدیل شود. پوسته و telemetry باید این رفتارها را مستقیم بسنجند.

تبار محتوا نیز به قرارداد خروجی آمده است. آنتروپیک می‌گوید متن Fable 5.1 و Mythos 5.1 در سطح‌های پشتیبانی‌شده watermark آماری دارد و فایل تصویر یا ویدیوی پشتیبانی‌شده که از Files API بازیابی شود می‌تواند Content Credentials امضاشده C2PA بگیرد. provenance به تشخیص منشأ کمک می‌کند، اما صحت ادعا یا امنیت کد را ثابت نمی‌کند.

حفاظت هنوز Fable و Mythos را دو سامانه می‌کند

کارت سیستم می‌گوید حفاظت سایبری Fable 5.1 همان دسته‌های پرخطر Fable 5 را پوشش می‌دهد، ولی کشف آسیب‌پذیری در کد منبع را برای دسترسی عمومی اجازه و کشف در binary کامپایل‌شده را مسدود می‌کند. classifier تازه کار دفاعی را به‌طور معنادار کمتر از حفاظت آغاز Fable 5 مسدود می‌کند، هرچند هنوز از Opus 5 بیشتر فعال می‌شود.

Mythos 5.1 برای کار تأییدشده سایبری و علوم زیستی محدود است. دسترسی ویژه، نتیجه مدل را به مجوز exploit، آزمایش یا ارسال داده حساس تبدیل نمی‌کند. محدوده، sandbox، بازبین متخصص و دروازه تأیید همچنان مسئولیت بیرون مدل‌اند.

هر دو مدل نگهداری ۳۰ روزه داده دارند و مگر با مجوز صریح آنتروپیک تحت zero data retention عرضه نمی‌شوند. این شرط برای کار تنظیم‌شده، محرمانه یا منتشرنشده تعیین‌کننده است. طبقه‌بندی داده و بازبینی قرارداد باید پیش از بارگذاری مجموعه ارزیابی انجام شود.

برنامه پذیرش تولید

مجموعه replayable را در چهار مسیر بسازید: مهندسی مخزن، پژوهش با artifact اجرایی، سند اداری و عمل رایانه یا API. شناسه دقیق مدل، effort، نسخه پوسته، وضعیت کش، مجوز ابزار، fallback ایمنی، زمان دیواری، هزینه توکن، دخالت انسان و نتیجه پذیرش ثبت شود.

شکست مهاجرت را عمداً اجرا کنید. ابزار اجباری بفرستید و خطای ۴۰۰ مورد انتظار را ببینید. مکالمه را از Fable 5.1 به مدل قدیمی‌تر مسیریابی و رفتار thinking block را ثبت کنید. turn قدیمی را در تاریخ آزمایشی تغییر دهید و سیاست mismatch را بسنجید. cache miss را کنار hit آرمانی آزمایش کنید.

عمل مادی پشت تأیید جدا بماند: merge، deploy، ارسال، خرید، تغییر مجوز، API مخرب و اجرای آزمایشگاهی. مدلی که کار بلند را بهتر ادامه می‌دهد پیش از دیده‌شدن فرض غلط مسافت بیشتری می‌رود. تکمیل قوی‌تر، دروازه شاهد را مهم‌تر می‌کند.

جمع‌بندی

Claude Fable 5.1 ارتقای واقعی کار بلندمدت است. شاهد قانع‌کننده افزایش کوچک SWE-bench Pro نیست؛ ترکیب دو برابرشدن امتیاز ترمینال علمی، پیشرفت ترمینال و عامل کسب‌وکار، منحنی بهتر کیفیت و هزینه در پوسته Cursor و قیمت کش مناسب زمینه تکراری است.

مهاجرت فقط تغییر نام مدل نیست. ابزار اجباری، سازگاری بلوک استدلال، تاریخ تغییرناپذیر، مشاهده پیشرفت، حفاظت و نگهداری داده روی سامانه مستقر اثر دارند. Fable 5.1 مسیر عمومی سخت‌ترین کار عادی و Mythos 5.1 مسیر محدود حوزه حساس تأییدشده است. آن‌ها را دو سامانه مؤثر با یک پایه توان مشترک ارزیابی کنید.

یادداشت منابع — بازبینی ۲۰۲۶

#Claude Fable 5.1#Claude Mythos 5.1#آنتروپیک#عامل هوش مصنوعی#بنچمارک مدل

مطالب مرتبط

یک فرایند را برای کشف نیاز مشخص کنید

اگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.