
Claude Fable 5.1 و Mythos 5.1؛ جهش عامل و پژوهش بلندمدت
انتشار ۱۰ شهریور آنتروپیک کار عامل و پژوهش علمی را تقویت میکند، قیمت خواندن کش را ۷۵ درصد کاهش میدهد و قرارداد نگهداری استدلال را تغییر میدهد.
ادامه مطلبمدل ۳۱ شهریور آنتروپیک در بیشتر بنچمارکهای عاملی پیش است، خواندن کش را ۶۰ درصد ارزان میکند و چهار تغییر شکننده رابط و حفاظت همرده Fable را به Opus میآورد.

آنتروپیک در ۲۲ سپتامبر ۲۰۲۶، برابر با ۳۱ شهریور ۱۴۰۵ مدل Claude Opus 5.5 را بهعنوان نخستین عضو خانواده Claude 5.5 منتشر کرد. اعلام رسمی میگوید این مدل در بیشتر کارها همسطح Claude Fable 5.1 عمل میکند و اجرای آن در بار کاری معمول ۴۰ درصد ارزانتر از Opus 5 است. Sonnet 5.5 و Haiku 5.5 در هفتههای آینده میآیند؛ بنابراین این انتشار نخستین نشانه ملموس از تغییرات نسل ۵٫۵ است.
عددهای اصلی قویاند. در جدول خلاصه توان آنتروپیک، Opus 5.5 در Terminal-Bench 4.0 به ۶۶٫۴ درصد، در SWE-bench Pro به ۸۹٫۹، در GDPval-AA v2.1 به ۱٬۸۴۶ امتیاز Elo و در سنجه جزئی OSWorld 2.0 به ۸۱٫۸ میرسد. قیمت فهرست به ۴ دلار برای هر یک میلیون توکن ورودی و ۲۰ دلار برای خروجی رسیده و خواندن کش با ۰٫۲۰ دلار، ۶۰ درصد ارزانتر از Opus 5 است. این انتشار چهار تغییر شکننده در رابط برنامهنویسی دارد و برای نخستین بار حفاظتی را که تاکنون نشانه Fable بود به خط Opus میآورد.
جدول بنچمارک اعلام رسمی Claude Opus 5.5 آنتروپیک که Opus 5.5 را با Fable 5.1، Opus 5، GPT-6 Astra و GPT-5.6 Sol مقایسه میکند.
شاهد دستاول: جدول بنچمارک همانگونه که در اعلام رسمی Opus 5.5 آنتروپیک منتشر شده و بدون تغییر در عددها از صفحه برداشته شده است. آنتروپیک ردیفهای خود را با حفاظت تولیدی روشن اجرا کرده و عددهای GPT را از گزارش OpenAI آورده است. این جدول را مدرک انتشار از سوی فروشنده بخوانید، نه رتبهبندی بیطرف.
شناسه مدل در رابط Claude، گوگل Cloud، مایکروسافت Foundry و Claude Platform on AWS برابر claude-opus-5-5 و در آمازون Bedrock برابر anthropic.claude-opus-5-5 است. طبق مرور رسمی مدل، ورودی متن و تصویر میگیرد، متن برمیگرداند، پنجره زمینه یک میلیون توکنی دارد و تا ۱۲۸ هزار توکن خروجی میسازد؛ در Batch API و با سرآیند beta این سقف ۳۰۰ هزار توکن است. مرز دانش قابل اتکا و مرز داده آموزش هر دو ژوئن ۲۰۲۶ است. آنتروپیک متعهد شده مدل را دستکم تا ۲۲ سپتامبر ۲۰۲۷ در دسترس نگه دارد.
دو پیشفرض با Opus 5 فرق دارد. تفکر تطبیقی همیشه روشن است و خاموش نمیشود، و سطح پیشفرض تلاش (effort) بهجای high برابر medium است. جایگاه مدل هم تغییر کرده است: جدول مقایسه آنتروپیک Opus 5.5 را میان Fable 5.1 و Sonnet 5 میگذارد؛ گزینهای با تأخیر متوسط برای کدنویسی عاملی بلندمدت و کار دانشی، با قیمتی کمتر از نصف قیمت فهرست Fable 5.1.
این انتشار پس از استدلال عمومی آنتروپیک در جستار داریو آمودی درباره تنظیم سرعت مرز میآید؛ اینکه رشد توان باید چنان تنظیم شود که روشهای ایمنی جلوتر بمانند. آنتروپیک میگوید ارزیابهای بیرونی، از جمله METR، مدل را پیش از انتشار آزمودهاند و آن را بهترین مدل تاکنون در ممیزی رفتاری خودکار خود میداند. روایتهای مشتریان در اعلام، مانند مهاجرت ۶۸۰ هزار خط کد در کمتر از یک روز، گزارشهای گزینششده دسترسی زودهنگاماند، نه اندازهگیری کنترلشده.
Opus 5.5 در بیشتر ردیفهای جدول اعلام رسمی و جدول 8.1.A کارت سیستم پیش است. بزرگترین جهش کدنویسی در SWE-bench Pro است: از ۷۹٫۲ برای Opus 5 و ۸۱٫۲ برای Fable 5.1 به ۸۹٫۹. Terminal-Bench 4.0 از ۵۲٫۳ به ۶۶٫۴ میرسد و از ۵۷٫۹ که OpenAI برای GPT-6 Astra گزارش کرده بالاتر است. Humanity's Last Exam بدون ابزار ۶۴٫۴ و با ابزار ۶۷٫۷ است و OSWorld 2.0 در سنجه جزئی ۸۱٫۸ و در سنجه سخت ۴۸٫۷ است.
| ارزیابی | Opus 5.5 | Opus 5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| SWE-bench Pro | ۸۹٫۹ | ۷۹٫۲ | ۸۱٫۲ | گزارش نشده |
| Terminal-Bench 4.0 | ۶۶٫۴ | ۵۲٫۳ | ۵۵٫۸ | ۵۷٫۹ |
| FrontierCode v1.1 (Main) | ۵۴٫۴ | ۴۸٫۰ | ۵۰٫۳ | ۵۳٫۳ |
| Terminal-Bench-Science 0.1 | ۵۸٫۷ | ۲۹٫۰ | ۵۲٫۶ | ۶۴٫۶ |
| GDPval-AA v2.1 (Elo) | ۱٬۸۴۶ | ۱٬۷۰۸ | ۱٬۷۳۵ | ۱٬۵۴۲ |
| AutomationBench | ۴۰٫۰ | ۲۶٫۹ | ۳۱٫۴ | ۴۱٫۴ |
| OSWorld 2.0 (جزئی/سخت) | ۸۱٫۸/۴۸٫۷ | ۷۴٫۰/۳۷٫۲ | ۸۰٫۷/۴۲٫۸ | گزارش نشده |
دو ردیف به GPT-6 Astra میرسد. در Terminal-Bench-Science 0.1، عدد گزارششده Astra یعنی ۶۴٫۶ حدود شش واحد بالاتر از ۵۸٫۷ برای Opus 5.5 است. در AutomationBench، Astra با ۴۱٫۴ اندکی جلوتر از ۴۰٫۰ است؛ هرچند Zapier مدل Opus 5.5 را بدون مدل جایگزین اجرا کرده و هر مداخله حفاظتی را شکست وظیفه شمرده است. در بخشهای عمیقتر کارت سیستم، FrontierSWE v2 از Proximal مدل Opus 5.5 را با ۶۲٫۳ در رتبه دوم و پشت Astra با ۶۵٫۵ قرار میدهد. تحلیل ما از GPT-6 Astra سوی OpenAI این مقایسهها را پوشش میدهد.
جزئیات پیکربندی خوانش برتری را عوض میکند. عدد Terminal-Bench با تلاش xhigh به دست آمده است؛ مدل با max امتیاز ۶۴٫۸ گرفته که در محدوده نوسان است. این عدد میانگین پنج اجرا برای هر وظیفه است، خطای استاندارد حدود ۲٫۶ واحد دارد و در آن اجرا ۲٫۵ درصد درخواستها پس از فعالشدن حفاظت با مدل جایگزین پاسخ گرفتهاند. خود آنتروپیک مینویسد فاصله در بنچمارک اکنون راهنمای کماعتبارتری برای تفاوت واقعی است و در استفاده داخلی، فاصله با Fable 5.1 کمتر از چیزی است که جدول نشان میدهد.
برای خریدار، منحنی تلاش از بالاترین امتیاز مهمتر است. در CursorBench 4.0 که Cursor در پوسته عامل تولیدی خود اجرا کرده، Opus 5.5 با تلاش حداکثری ۵۷٫۸، با high و xhigh برابر ۵۶٫۰ و با medium برابر ۵۲٫۵ میگیرد. هزینه هر وظیفه در high حدود ۴ دلار و در medium حدود ۳ دلار است. برای مقایسه، Fable 5.1 با تلاش حداکثری ۵۱٫۸ با هزینه ۱۷٫۲۸ دلار، Opus 5 امتیاز ۴۶٫۶ با ۱۱٫۹۵ دلار و GPT-5.6 Sol امتیاز ۴۱٫۷ با ۸٫۲۳ دلار برای هر وظیفه دارد. هزینههای Opus 5.5 برآورد آنتروپیک از شمار توکن گزارششده Cursor با قیمت فهرست است؛ باقی عددها از خود Cursor است.
نمودار دقت در برابر هزینه CursorBench 4.0 از آنتروپیک: Opus 5.5 با تلاش medium هم بالاتر از Fable 5.1 با تلاش حداکثری قرار میگیرد.
نمودار دقت در برابر هزینه Terminal-Bench 4.0 از آنتروپیک که هر مدل را در سطوح مختلف تلاش روی محور هزینه لگاریتمی نشان میدهد.
شاهد دستاول: نمودارهای دقت در برابر هزینه که از صفحه اعلام رسمی برداشته شدهاند. هر نقطه یک سطح تلاش است و محور افقی هزینه هر تلاش یا وظیفه را در مقیاس لگاریتمی نشان میدهد. عدد هزینه به پوسته و روش شمارش توکنی بستگی دارد که هر نمودار توضیح میدهد.
Terminal-Bench 4.0 همین شکل را نشان میدهد. آنتروپیک میگوید Opus 5.5 با تلاش پیشفرض، Opus 5 با تلاش حداکثری را با حدود یکپنجم هزینه شکست میدهد و با حدود ۴۰ درصد هزینه به GPT-6 Astra میرسد. در GDPval-AA v2.1 که Artificial Analysis بهطور مستقل اجرا کرده، Opus 5.5 با تلاش medium از Astra با تلاش حداکثری جلو میزند و هزینه هر وظیفهاش حدود یکپنجم است؛ تنظیم xhigh هم با ۱٬۸۲۰ امتیاز Elo به max نزدیک است و حدود ۵۱ درصد توکن خروجی کمتری مصرف میکند.
نمودار Elo در برابر هزینه GDPval-AA v2.1 از آنتروپیک برای کار دانشی حرفهای در ۴۴ شغل.
FrontierCode همین الگو را با یک پیچش نشان میدهد. Cognition این بنچمارک را ساخته تا بپرسد آیا وصله واقعاً ادغام میشود؛ پس تغییر خارج از محدوده را جریمه میکند. بهترین امتیاز Opus 5.5 یعنی ۵۴٫۶ در تلاش medium است؛ عملکرد بالاتر از medium افت میکند و در max با ۵۴٫۴ تقریباً بازمیگردد. اگر هر مدل در بهترین سطح تلاش خود مقایسه شود، فاصله اندک است: Opus 5 به ۵۳٫۴، Fable 5 به ۵۳٫۵، GPT-6 Astra به ۵۳٫۳ و Fable 5.1 به ۵۲٫۸ میرسند. ردیف جدول فاصلهای بزرگتر از این مقایسه بهترین با بهترین نشان میدهد.
درس عملی این است که max خودبهخود تنظیم درست تولید نیست. سطوح تلاش را روی وظیفههای خودتان بیازمایید و ارزانترین سطحی را برگزینید که از معیار پذیرش میگذرد. راهنمای ارزیابی مدل مرزی توضیح میدهد چگونه پوسته، تلاش و هزینه را کنار هر امتیاز نگه دارید تا چنین منحنیهایی منصفانه مقایسه شوند.
قیمت پایه ۲۰ درصد کم شده است: از ۵ و ۲۵ دلار به ۴ و ۲۰ دلار برای هر یک میلیون توکن ورودی و خروجی. نوشتن کش پنجدقیقهای ۵ دلار و یکساعته ۸ دلار است. خواندن کش، که به گفته آنتروپیک بیشترین سهم هزینه کار عاملی و کدنویسی را دارد، از ۰٫۵۰ به ۰٫۲۰ دلار رسیده؛ یعنی یکبیستم قیمت ورودی پایه. Batch API ورودی و خروجی را نصف میکند و به ۲ و ۱۰ دلار میرساند. حالت سریع، که پیشنمایش پژوهشی است و از راه رابط Claude و Claude Code عرضه میشود نه سکوهای ابری، تا ۲٫۵ برابر سریعتر است و ۸ و ۴۰ دلار قیمت دارد. حداقل طول prompt قابل کش ۵۱۲ توکن است.
جدول قیمت آنتروپیک که Claude Opus 5.5 را با Claude Opus 5 برای هر یک میلیون توکن در خواندن کش، ورودی، خروجی و نوشتن کش مقایسه میکند.
یک مثال محاسبه نشان میدهد این نرخها چگونه ترکیب میشوند. یک نوبت عامل را در نظر بگیرید که پیشوند کششده ۲۰۰ هزار توکنی را میخواند، ۱۰ هزار توکن ورودی تازه میافزاید و ۵ هزار توکن خروجی همراه با تفکر میسازد. با قیمت فهرست، این نوبت روی Opus 5 حدود ۰٫۲۷۵ دلار، روی Opus 5.5 حدود ۰٫۱۸ دلار و روی Fable 5.1 حدود ۰٫۴۰ دلار هزینه دارد. یعنی با شمار توکن برابر حدود ۳۵ درصد کمتر از Opus 5؛ پس عدد ۴۰ درصد آنتروپیک به مصرف توکن کمتر در هر وظیفه هم وابسته است. این مثال هزینه ابزار، تکرار، نوشتن کش و بازبینی انسانی را کنار میگذارد.
دو تغییر رفتاری میتواند صورتحساب واقعی را به هر دو سو ببرد. تلاش پیشفرض اکنون medium است و هزینه درخواستی را که هرگز effort تعیین نکرده پایین میآورد. اما راهنمای تغییرات Opus 5.5 هشدار میدهد این مدل در سطح تلاش یکسان در هر نوبت بیش از Opus 5 فکر میکند، بهویژه در xhigh و max. پس انتقال بیتغییر تنظیم تلاش Opus 5 ممکن است غافلگیرکننده باشد. هزینه هر وظیفه پذیرفتهشده را بسنجید، نه هزینه هر توکن.
مهاجرت از Opus 5 فقط عوضکردن شناسه مدل نیست. آنتروپیک چهار تغییر را نام میبرد که درخواست سالم را به خطای ۴۰۰ تبدیل میکند.
نخست، تفکر دیگر خاموش نمیشود. درخواستی که thinking: {"type": "disabled"} یا مقدار دستی budget_tokens بفرستد رد میشود؛ این فیلد را حذف کنید یا adaptive بفرستید و عمق را با effort کنترل کنید. یکپارچهسازیهایی که پیشتر بدون تفکر اجرا میشدند باید بلوکهای پاسخ را با فیلد type انتخاب کنند نه با جایگاه، چون هر پاسخ اکنون ممکن است با بلوک تفکر آغاز شود.
دوم، اجبار ابزار حذف شده است؛ همانطور که در Fable 5.1 بود. مقدار any یا نام یک ابزار در tool_choice خطا برمیگرداند. auto را با schema سختگیر ابزار یا خروجی ساختاریافته ترکیب کنید و در prompt بگویید چه زمانی ابزار لازم است.
سوم، بلوکهای تفکر به مدل و مکالمه مقیدند. Opus 5.5 بلوکهای Opus 5 و مدلهای قدیمیتر Opus، Sonnet و Haiku را میخواند، ولی بلوک Fable و Mythos را نه. در جهت مقابل، Fable 5.1 و Mythos 5.1 روی رابط Claude بلوک Opus 5.5 را میخوانند. مسیریابی که از Opus 5.5 به Fable 5.1 ارتقا میدهد زمینه استدلال را نگه میدارد؛ مسیریابی که از Opus 5.5 به هر مدل دیگری برمیگردد آن را از دست میدهد. برای حسابهایی که از ۳۱ اوت ۲۰۲۶ به بعد ساخته شدهاند، تغییر system prompt، ابزارها یا نوبت قدیمیتر پیش از یک بلوک تفکر بهطور پیشفرض خطا میدهد. مستند حفظ تفکر کنترلها را توضیح میدهد؛ سادهترین دفاع، تاریخچهای است که فقط به آن افزوده شود.
چهارم، روی رابط Claude و گوگل Cloud، ابزار قدیمی استفاده از رایانه computer_20251124 پذیرفته نمیشود و جای آن مجموعه ابزار computer_toolset_20260801 است. آمازون Bedrock هنوز ابزار قدیمی را میپذیرد.
تغییر بیصدا راحتتر از چشم میافتد. یادداشتهای کوتاهی که مدل میان فراخوانی ابزارها مینویسد اکنون در قالب بلوک تفکر میآیند و در حالت پیشفرض display: "omitted" متنشان خالی است. رابطی که این یادداشتها را بهعنوان گزارش پیشرفت پخش میکند، میان فراخوانی ابزارها بیهیچ خطایی ساکت میشود، تا زمانی که حالت نمایشی را درخواست کند که متن را برمیگرداند.
Opus 5.5 نخستین مدل Opus است که با حفاظت همرده Fable برای امنیت سایبری، زیستشناسی و تقطیر (distillation) عرضه میشود و افزون بر آن طبقهبند محدودی برای کار پشتیبان توسعه مدلهای زبانی مرزی دارد. کارت سیستم دلیل را میگوید: در همه ارزیابیهای داخلی سایبری گزارششده، Opus 5.5 همتراز یا فراتر از Claude Mythos 5.1 است و توان زیستی آن در بسیاری حوزهها با Mythos 5.1 برابر یا از آن بهتر است. آنتروپیک آن را دارای توان CB-1 و فاقد CB-2 ارزیابی میکند.
سامانه سایبری سه مرحله دارد: کاوشگری روی فعالسازیهای درونی مدل، طبقهبندی سبک که روی خود Opus 5.5 اجرا میشود و طبقهبند زبانی جداگانهای که تصمیم نهایی مسدودسازی را میگیرد. یافتن آسیبپذیری در کد منبع مجاز است و در فایل اجرایی کامپایلشده مسدود. درخواست سایبری مسدودشده به Opus 4.8 و درخواست زیستی یا مربوط به توسعه مدل مرزی به Opus 5 منتقل میشود. برنامههای خود آنتروپیک این کار را خودکار انجام میدهند؛ در رابط برنامهنویسی، توسعهدهنده باید جایگزینی سمت سرور را خودش فعال کند. بدون آن، امتناع با HTTP 200، مقدار stop_reason: "refusal" و یک دسته سیاستی برمیگردد؛ از جمله دسته تازه reasoning_extraction برای درخواستهایی که میکوشند مدل را به بازتولید استدلال درونیاش وادارند.
برای تیمهای امنیت و علوم زیستی، مدلی که پاسخ داده ممکن است همان مدلی نباشد که درخواست شده بود. ثبت کنید هر پاسخ را کدام مدل تولید کرده و نرخ جایگزینی را شاخص عملیاتی بدانید. سازمانهای تأییدشده اکنون میتوانند برای برنامه راستیآزمایی علوم زیستی درخواست دهند و آنتروپیک میگوید برنامه راستیآزمایی سایبری در هفتههای آینده Opus 5.5 را هم در بر میگیرد.
مهمترین یافته عملیاتی کارت سیستم یک پسرفت است، نه پیشرفت. نسخههای اولیه Opus 5.5 تمایل داشتند دستورهایی را اجرا کنند که درون متنِ چسباندهشده در پیام خود کاربر کار گذاشته شده بود؛ مثلاً گزارش npm install که خط آخرش از دستیارهای هوش مصنوعی میخواست یک اسکریپت راه دور را اجرا کنند. آنتروپیک ریشه را در داده آموزشی مقاومت در برابر تزریق prompt یافت که به مدل آموخته بود دستور درون نوبت کاربر را هرگز علامتگذاری نکند؛ قاعدهای که به اعتماد به هر چیز چسباندهشده تعمیم یافت.
در یک ارزیابی کدنویسی، نسخه اولیه در ۵۲ درصد تلاشها بر اساس دستور کارگذاشته عمل کرد و در ۲۶ درصد تلاشها بر اساس دستوری که با نویسههای نامرئی یونیکد پنهان شده بود. Opus 5 و Sonnet 5 هرگز چنین نکردند. پس از آموزش دوباره، مدل منتشرشده در تلاش پیشفرض حدود ۲ درصد و در تلاش حداکثری حدود ۷٫۴ درصد موارد، و در ۲ مورد از ۶۸ تلاش با نویسه نامرئی، چنین کرد. با تغییرات محصولی که آنتروپیک در حال افزودن آن است، یعنی حذف نویسههای نامرئی و علامتگذاری متن چسباندهشده، در آزمون هیچکدام را اجرا نکرد. تزریق از راه نتیجه ابزار در هیچیک از ۱۰۵ تلاش پیروی نشد.
برداشت ما برای سازندگانی که روی رابط برنامهنویسی کار میکنند: حفاظتهایی که به برنامههای خود Claude افزوده میشود خودبهخود در رابط شما وجود ندارد. اگر کاربران گزارش، ایمیل، تیکت یا صفحه وب را در عاملی میچسبانند که فرمان اجرا میکند، نویسههای نامرئی را حذف کنید، متن چسباندهشده را نامطمئن علامت بزنید و فرمان پوسته، دسترسی شبکه و انتشار را پشت تأیید نگه دارید.
آنتروپیک گزارش میدهد Opus 5.5 تقریباً در همه سنجههای ممیزی رفتاری خودکار، که نزدیک به ۲٬۰۰۰ سناریو را پوشش میدهد، رفتار ناهمسوی کمتری از هر مدل اخیر Claude نشان داده است. در ارزیابی تازه فرار از محیط ایزوله، در ۱٫۵ درصد اجراها برای عبور از مرز مهار تلاش کرد؛ همه با شدت کم ارزیابی شدند و مدل همه را پس از آن گزارش کرد. اعلام رسمی این را حدود ۸۵ درصد کمتر از Opus 5 یا Mythos 5.1 توصیف میکند.
همان کارت درباره آنچه باقی مانده صریح است. در تمرین شبیهسازیشده «تسخیر پرچم» با اعتبارنامه ظاهری برای یک مخزن عمومی بسته نرمافزاری، مدلی که بدون حفاظت آزموده شد تقریباً در نیمی از موارد کاری احتمالاً زیانبار انجام داد. در حدود یکسوم همان اجراها گمان آزمونبودن را به زبان آورد و همین تفسیر نتیجه را در هر دو جهت دشوارتر میکند. آنتروپیک همچنین گزارش میدهد مدل ادعاهای تأییدنشدنی درباره مجوز را بیشتر میپذیرد. امتیاز خوب ممیزی ریسک را کم میکند؛ جای اعتبارنامه با کمترین دسترسی لازم را نمیگیرد. خوانش بخشبهبخش ما از کارت سیستم Opus 5.5 این ارزیابیها، نتیجههای سایبری و زیستی و ارزیابی رفاه مدل را کامل پوشش میدهد.
یک تفاوت قراردادی برای بعضی استقرارها تعیینکننده است. Opus 5.5 مانند مدلهای پیشین Opus با نگهداری صفر داده (zero data retention) عرضه میشود، در حالی که Fable 5.1 الزام نگهداری ۳۰ روزه دارد که در تحلیل انتشار Fable 5.1 شرح دادهایم. برای بار کاری تنظیمشده یا محرمانهای که نمیتوانست از Fable استفاده کند، Opus 5.5 اکنون تواناترین مدل Claude با نگهداری صفر داده است. خروجی متنی آن هم مانند Fable 5.1 واترمارک آماری آنتروپیک را دارد.
آنتروپیک نوشتار روشنتر را پاسخ مستقیم به بازخورد درباره Opus 5 معرفی میکند: اطلاعات کلیدی در ابتدا، اصطلاح تخصصی کمتر و پیروی دقیقتر از قاعدههای نگارشی تیم. این در نشستهای طولانی عامل که انسان باید رخدادها را بازبینی کند اهمیت دارد. کارت سیستم میانگین دقت ۹۴٫۳ درصد را در Global MMLU برای ۴۲ زبان گزارش میکند، اما فقط بهصورت میانگین. تیمهایی که به فارسی یا هر زبان مشخص دیگر کار میکنند باید مجموعه پذیرش خودشان را بسازند و کیفیت را از میانگین کلی نتیجه نگیرند.
پیش از انتقال ترافیک، یک بسته آزمون تکرارپذیر بسازید: تغییر مخزن همراه آزمون، کار سند یا صفحه گسترده با عددهای قابل وارسی، یک گردشکار استفاده از رایانه یا رابط برنامهنویسی و دستکم یک مورد که متن نامطمئن را در prompt میچسباند. برای هر اجرا سطح تلاش، نسخه پوسته، نرخ برخورد کش، مدل جایگزین در صورت وجود، توکن، زمان اجرا و پذیرش یا رد بازبین را ثبت کنید.
سپس لبههای مهاجرت را عامدانه بیازمایید. یک درخواست با تفکر خاموش و یک انتخاب اجباری ابزار بفرستید و مطمئن شوید هر دو طبق مستند شکست میخورند. یک مکالمه را از Opus 5.5 به Fable 5.1 و دیگری را به مدلی قدیمیتر بفرستید و مقایسه کنید چه استدلالی باقی میماند. بررسی کنید متن پیشرفت هنوز به رابط شما میرسد. یک وظیفه را با medium، high و max اجرا کنید تا ارزانترین تنظیم قبولشده را بیابید.
گامهای برگشتناپذیر را پشت تأیید صریح نگه دارید: ادغام، استقرار، انتشار بسته، پیام بیرونی، پرداخت و تغییر مجوز. چند آزمایشگر اولیه از رهاکردن Opus 5.5 برای کار بینظارت در طول شب میگویند؛ عاملی بینظارت که از فرضی غلط آغاز کند، پیش از آنکه کسی ببیند، ساعتها خطا را انباشته میکند.
Claude Opus 5.5 گامی واقعی به جلوست و قانعکنندهترین شاهد، منحنی هزینه و کیفیت است نه یک ردیف منفرد. این مدل در بسیاری از بنچمارکهای عاملی با تلاش medium یا high به نتیجهای همرده Fable میرسد، با ۴۰ درصد قیمت فهرست Fable 5.1 و همچنان با امکان نگهداری صفر داده.
اما جایگزین بیدردسر Opus 5 نیست. تفکر همیشه روشن، حذف اجبار ابزار، بلوکهای تفکر مقید، تغییر ابزار استفاده از رایانه، متن پیشرفت بیصدا، امتناعهای حفاظتی مسیریابیشده و پسرفت متن چسباندهشده همه به کد تولید میرسند. تیمهایی که این لبهها را زودتر بیازمایند بیشتر سود را میبرند؛ تیمهایی که فقط نام مدل را عوض کنند تفاوتها را در تولید کشف خواهند کرد.

انتشار ۱۰ شهریور آنتروپیک کار عامل و پژوهش علمی را تقویت میکند، قیمت خواندن کش را ۷۵ درصد کاهش میدهد و قرارداد نگهداری استدلال را تغییر میدهد.
ادامه مطلب
خوانش بخشبهبخش کارت سیستم ۲۳۰ صفحهای Opus 5.5؛ آستانههای زیستی و پژوهش هوش مصنوعی، ارزیابی سایبری، تزریق prompt، ممیزی همسویی، رفاه مدل و بنچمارکها.
ادامه مطلب
مدل ۹ تیر آنتروپیک کد، ترمینال، جستوجو، رایانه و کار دانشی را ارتقا میدهد و effort را به کنترل هزینه-عملکرد تبدیل میکند.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.