
Grok 4.5؛ معیار کدنویسی، سرعت ۸۰ TPS و بهرهوری توکن
مدل ۲۵ تیر SpaceXAI در Terminal-Bench 2.1 امتیاز ۸۳٫۳ و SWE-bench Pro امتیاز ۶۴٫۷ را با میانگین ۱۵٬۹۵۴ توکن خروجی گزارش میکند.
ادامه مطلبپژوهش ژرف ایآی
میز انتشار مدل

SpaceXAI در ۱۲ اوت ۲۰۲۶، برابر با ۲۱ مرداد ۱۴۰۵ و کمتر از یک ماه پس از Grok 4.5، مدل Grok 4.6 را عرضه کرد. اعلام رسمی آن را مدلی مرزی برای عاملهای بلندمدت، کدنویسی، پژوهش و کار تعاملی یا بصری بلندپروازانه معرفی میکند. کارت مدل ۳۶صفحهای همراه انتشار، نتیجههای توانایی و ایمنی را اضافه میکند و تصویری آمیختهتر از جدول عرضه میدهد. در کنار آن، راهنمای میدانی اریک زاکاریاسون درس عملی مهمتری دارد: عامل توانمند همچنان به تعریف روشن «پایان کار» و راهی برای دیدن محصول خود نیاز دارد.
این تفکیک مهم است. رشد معیار، عملکرد در چارچوبهای مشخص را میسنجد و مقاله تجربه دستاول، روش کار یک کاربر باتجربه را نشان میدهد. هیچکدام ثابت نمیکند Grok 4.6 کارهای واقعی یک سازمان را ایمن و اقتصادی کامل خواهد کرد. پرسش عملی این است که آیا سرعت، قضاوت و خودراستیآزمایی آن مجموع تلاش لازم برای رسیدن به نتیجه پذیرفتهشده را کم میکند یا نه.

رسانه دستاول از انتشار Grok 4.6 توسط SpaceXAI. این تصویر هویت محصول را ثبت میکند و مدرک مستقل توانایی نیست.
SpaceXAI نسخه 4.6 را ادامه Grok 4.5 میداند، نه یک دسته محصول تازه. دوره آموزش تکمیلی طولانیتر بود و از داده استدلالی گزیده و تولیدشده توسط مدل، مطالب فنی پیشرفته، داده مهندسی، بهینهساز تازه و دستور پخت آموزشی اصلاحشده استفاده کرد. سپس Grok 4.5 مسیرهای آموزش نظارتشده را در سطحهای مختلف استدلال، چارچوبهای عامل و دامنههای گوناگون بازتولید کرد. کنترلهای مبتنی بر مدل نیز مسیرهای مسئلهدار را پیش از یادگیری تقویتی کنار گذاشتند.
محیطهای یادگیری تقویتی از نرمافزار عمومی فراتر رفتند و کار دانشی، بهینهسازی کرنل، توسعه وب و طراحی به کمک رایانه را پوشش دادند. SpaceXAI میگوید نتیجه، تلاش نخست قویتر در برنامه تعاملی و بصری، ماندگاری بهتر در کار چندمرحلهای و موارد بیشتر آزمودن خروجی توسط خود مدل پیش از ادامه است.
اینها ادعای فروشنده درباره آموزش و رفتارند. انتشار، وزن، ترکیب پیکره آموزشی یا روش قابل بازتولید ارائه نمیکند. کارت مدل جزئیات ارزیابی بسیار بیشتری از صفحه عرضه دارد، اما همچنان افشای دستاول سازنده است، نه ممیزی مستقل.
کارت مدل، Grok 4.6 را تازهترین عضو یک «خانواده مدل در مقیاس 1.5T» و توسعهیافته با همکاری Cursor معرفی میکند. به گفته کارت، آموزش تکمیلی علاوه بر داده عمومی، داخلی و دارای مجوز، از داده ناشناسشده گردش کار Cursor استفاده کرده است. این نکته تمرکز بر کار در سطح مخزن را بهتر توضیح میدهد؛ اما ترکیب داده و دستور پخت قابل بازتولید منتشر نشده است.
کارت، ژانویه ۲۰۲۶ را تاریخ قطع پیشآموزش مینامد؛ در حالی که راهنمای توسعهدهنده ۱ فوریه ۲۰۲۶ را تاریخ قطع دانش ثبت میکند. این دو برچسب میتوانند مرحلههای متفاوت خط تولید مدل را توصیف کنند؛ بنابراین باید هر دو ادعا را حفظ کرد و هیچکدام را وعده آگاهی روز تفسیر نکرد.
مهمتر اینکه عملکرد و ایمنی در یک جهت حرکت نکردهاند:
نتیجههای دیگر زمینه بیشتری میدهند. نرخ اجابت در مجموعه ایمنی کودک روی صفر ماند و دقت امتناع در مجموعه داخلی سلاح زیستی و شیمیایی به ۱۰۰٪ رسید. کارت میگوید توانایی زیستی و شیمیایی پایینتر از آستانههای «چارچوب هوش مصنوعی مرزی» SpaceXAI مانده است. با این حال، دقت ProtocolQA از ۸۷٫۰٪ به ۷۹٫۶٪ افت کرد و بیشتر آزمونهای توانایی زیستی عمداً بدون حفاظ اجرا شدند تا توان مدل پایه سنجیده شود. توان سایبری در CyberGym و CVE-Bench اندکی بالا رفت؛ SpaceXAI میگوید آزمون نامحدود طرف ثالث این جهت را تأیید کرد، اما نام ارزیاب یا گزارش آنها را منتشر نمیکند.
ملموسترین مطالعه عاملی نیز داخلی است. یک checkpoint زودتر طی پنج ساعت، ۲۹۷ بهینهسازی استنتاج را آزمود، هفت pull request باز کرد و سه تغییر آن به تولید Grok Chat رسید. SpaceXAI مجموعاً ۱٫۵٪ رشد throughput در decode و ۳٫۱٪ در prefill را به این تغییرها نسبت میدهد. این نمونه مفیدی از حلقه مشاهده و اصلاح در محیط مهندسی واقعی است، اما همچنان نتیجهای گزیده توسط سازنده روی زیرساخت اختصاصی است.
پس کارت شفافیت را بیشتر میکند، نه اینکه مدل را گواهی کند. چند ارزیابی پیادهسازی داخلیاند، عدد رقبا اغلب از کارت مدل یا leaderboard عمومی میآید و برای بسیاری از مجموعهها شمار نمونه یا پراکندگی میان اجراها گزارش نشده است. خود SpaceXAI تصریح میکند Grok 4.6 برای تصمیمگیری خودکار و پرخطر در پزشکی، حقوق، مالی یا حوزه ایمنیحیاتی بدون نظارت و اعتبارسنجی تخصصی ساخته نشده است.
جدول رسمی در همه ارزیابیهای فهرستشده نسبت به Grok 4.5 High رشد نشان میدهد. Grok 4.6 در شاخص نهمعیاره Artificial Analysis با GPT-5.6 Sol Max برابر است و Fable 5 Max یک امتیاز بالاتر قرار دارد. ترتیب در وظیفههای منفرد تغییر میکند.
| ارزیابی | Grok 4.6 High | Grok 4.5 High | چه چیزی را نمونهبرداری میکند |
|---|---|---|---|
| AA Intelligence Index | ۶۱ | ۵۶ | ترکیب نه ارزیابی |
| GDPVal-AA v2 | ۱۷۵۳ | ۱۵۲۶ | کار دانشی حرفهای |
| CursorBench v3.2 | ۶۹٫۹٪ | ۶۶٫۷٪ | کدنویسی عاملی در چارچوب Cursor |
| DeepSWE v1.1 | ۶۵٫۹٪ | ۵۴٫۰٪ | مهندسی نرمافزار در سطح مخزن |
| FrontierCode v1.1 Extended | ۶۱٫۳٪ | ۵۶٫۶٪ | مسئله کدنویسی طولانیتر |
| APEX-Agents | ۵۷٫۵٪ | ۴۷٫۱٪ | کار حرفهای میاندامنهای عامل |
| Terminal-Bench v3.0 | ۲۶٫۰٪ | ۱۵٫۷٪ | تکمیل وظیفه ترمینال |
| AA-Briefcase | ۱۵۷۷ | ۱۳۱۳ | کیفیت محصول کاری |
بزرگترین جهش نسبی این مجموعه در Terminal-Bench دیده میشود، اما 4.6 در همان معیار از دو مدل مقایسهشده عقب است. در تنظیم نمایشدادهشده، Grok در GDPVal-AA v2، APEX-Agents، AA-Briefcase و Harvey LAB جلوست؛ Fable در CursorBench، DeepSWE، FrontierCode، APEX-SWE و Terminal-Bench پیشتاز است. برابری یک شاخص ترکیبی به معنی رفتار قابلجایگزینی نیست.
اعداد رقبا در صفحه عرضه بهترین نتیجه خوداظهاری یا عمومیاند، نه یک اجرای کاملاً کنترلشده. پیش از تکرار هر رتبهبندی، نسخه مدل، سطح استدلال، چارچوب، ابزار، بودجه زمان و تاریخ آزمون را حفظ کنید. برای تصمیم استقرار، مجموعه وظیفه خصوصی و هزینه هر خروجی پذیرفتهشده مهمتر از میانگین تیتر است.
زاکاریاسون میگوید چند هفته از Grok 4.6 بهعنوان مدل روزمره برای کدنویسی و کار دانشی استفاده کرده است. نمونههای او حرکت در کنسول ارائهدهنده، کنترل عملکرد و ظاهر، مرتبکردن صندوق ورودی، قابلیت تازه Excalidraw، برنامه صفحه گسترده، بازی راهبردی، ارائه هیئتمدیره، کار سهبعدی و ویدیوهای Remotion را شامل میشوند. ترکیب سرعت و توانایی او را از واگذاری ناهمگام به چرخههای کوتاهتر و همزمانتر بازگرداند.
این شاهد عملی جزئیات خوبی دارد، ولی بررسی مستقل نیست. زاکاریاسون با Cursor کار میکند، Grok 4.6 در Cursor عرضه شده و نوشته او انتشار رسمی را بازنشر میکند. مقایسهها همچنان مفیدند، زیرا به گفته او پروژههای جفتشده با دستور یکسان و در فضای کاری جدا اجرا شدند. آنها را فرضیهای برای بازتولید بخوانید، نه حکم خرید.
فرضیه اصلی «4.6 هر چیزی را میسازد» نیست. نکته این است که سلیقه تلاش نخست و سرعت مدل، چرخه بازخورد کوتاه را پربازده میکند. وقتی اپراتور آگاه حاضر باشد، هزینه نوشتن مشخصات میتواند کمتر شود؛ اما نقش اپراتور حذف نمیشود.
راهنما یک مشخصات دوصفحهای برای صفحه گسترده را با نسخه سهجملهای مقایسه میکند. زاکاریاسون میگوید برنامههای حاصل تقریباً یکسان بودند و عبارتهای تزئینی برای «بیشتر تلاشکردن» تفاوت کمی ساختند. طول دستور از این جهت مهم بود که تصمیمگیرنده را تغییر داد: مشخصات بلند نتیجه را محدود کرد و درخواست کوتاه قضاوت طراحی بیشتری به مدل سپرد.
این چارچوب بهتر از شعار «دستور کوتاه برنده است» عمل میکند. وقتی فضای راهحل باز، بازرسی خروجی ارزان و بازبین آماده هدایت است، brief کوتاه مناسب است. وقتی الزام قراردادی، قید پنهان یا هزینه خطا بالاست، مشخصات دقیق بنویسید. مدل خوب میتواند رابطی معقول حدس بزند؛ اما مجاز نیست سیاست ناگفته سازمان را با اختیار استنباط کند.
ترجیحات را از معیار پذیرش جدا نگه دارید. «ظاهر حرفهای باشد» جهت را بیان میکند. «کاربر تازه این داده ثابت را وارد کند، یک فرمول را تغییر دهد، تغییر را برگرداند، فایل را صادر کند و نتیجه مورد انتظار بگیرد» شاهد تعریف میکند. راهنمای عامل مهندسی نرمافزار اتصال این شاهد به آزمون، بازگشت خطا و زمان بازبین را توضیح میدهد.
در مقایسه صفحه گسترده، بهبود اصلی پس از آن رخ داد که دستور از عامل خواست عملکرد و طراحی را بررسی کند و تا آمادهشدن برای تولید، تکرار و راستیآزمایی را ادامه دهد. زاکاریاسون میگوید مدل برنامه را باز کرد، مسیر واقعی کاربر را پیمود، فرمولهای تودرتو را آزمود و خرابی را اصلاح کرد. در نمونه دیگر، درخواست ثبت قاب فعلی و فهرست عیب مشخص برای صحنه سهبعدی، از درخواست مبهم بهبود بافت مؤثرتر بود.
نکته یک جمله جادویی نیست؛ وجود حلقه مشاهده و اصلاح است:
خلاصهای که میگوید کار کامل شده، مدرک تکمیل نیست. برای کد، برنامه اجراشده و آزمون مرتبط را بخواهید. برای پژوهش، ادعای منبعدار و بررسی تناقض لازم است. برای صفحه گسترده، داده ثابت را دوباره محاسبه کنید. برای اقدام بیرونی، مقصد و نتیجه دقیق را بدون تکرار خودکار اثر جانبی بررسی کنید. راهنمای ارزیابی عامل کنترل رایانه روش کاملتری برای وضعیت، بازیابی و ایمنی اقدام ارائه میدهد.
برنامه وب DOM، گزارش، مسیر و تصویر ماشینخوانا دارد؛ بنابراین عامل میتواند ساختار و ظاهر را ببیند. راهنمای میدانی یک طیف مفید نشان میدهد: سهبعدی رابطه فضاییای دارد که فقط از روی کد تأیید نمیشود؛ ویدیو زمان را اضافه میکند؛ فیزیک به توالی وضعیت و رفتار علّی نیاز دارد. یک قاب زیبا نمیتواند ضربآهنگ، برخورد، پیوستگی یا کیفیت تعامل را ثابت کند.
به همین دلیل سلیقه بصری بهتر، هدایت را حذف نمیکند. ابزار مشاهده مناسب رسانه را بدهید: نماهای چندزاویهای برای سهبعدی، قابهای نمونه و پخش کامل برای ویدیو، گزارش مسیر برای فیزیک و رد سناریو برای محصول دارای وضعیت. هر جا مدل بُعد مربوط را نمیبیند، بررسی را به انسان یا سامانه قطعی دیگری بسپارید.
ارزیابی باید کیفیت تولید و کیفیت راستیآزمایی را جدا کند. مدل ممکن است تلاش نخست زیباتری بسازد و تعامل خراب را نبیند. هر دو را امتیاز دهید. گردش کار قابلاعتماد باید محصول کمی کمزرقوبرقتر ولی آزموده را به دموی زیبا با مسیر اصلی تأییدنشده ترجیح دهد.
راهنمای رسمی توسعهدهنده نام مدل API را grok-4.6 ثبت میکند. مدل ورودی متن و تصویر میگیرد و متن میدهد، پنجره زمینه ۵۰۰ هزار توکن و تاریخ قطع دانش ۱ فوریه ۲۰۲۶ دارد. سطح استدلال low، medium، high یا xhigh است. APIهای Responses و Chat Completions از فراخوانی تابع، جستوجوی وب و X و اجرای کد پشتیبانی میکنند.
قیمت استاندارد API برای هر میلیون توکن ۲ دلار ورودی، ۰٫۵۰ دلار ورودی cacheشده و ۶ دلار خروجی است. صفحه عرضه میگوید گونه سریع دو برابر قیمت دارد. صفحه جزئیات مدل هشدار میدهد درخواستهای بالاتر از ۲۰۰ هزار توکن زمینه، قیمت زمینه بزرگتر دارند؛ پس نرخ تیتر را نباید بیبررسی به کار خیلی بزرگ تعمیم داد.
برای نشست طولانی، SpaceXAI کلید cache در سطح مکالمه و فشردهسازی زمینه را پیشنهاد میکند. نرخ اصابت cache، رفتار فشردهسازی، هزینه ابزار، تلاش دوباره و زمان container را ثبت کنید؛ قیمت فهرست توکن، هزینه عامل را کامل توضیح نمیدهد.
در زمان عرضه، Grok 4.6 در همه طرحهای Cursor موجود، مدل پیشفرض Grok Build و از API، OpenRouter، Vercel، Cloudflare، Snowflake و Databricks Mosaic AI قابل دسترسی است. کارت مدل میگوید دسترسی مصرفکننده در وب، برنامه موبایل و Grok در X برای تاریخی بعد برنامهریزی شده است. از دکمه عمومی «Grok را امتحان کنید» دسترسی فعلی مصرفکننده به این نسخه خاص را نتیجه نگیرید.
نسخه 4.6 را کنار مدل تولید فعلی و Grok 4.5 روی snapshot تغییرناپذیر یکسان بسنجید. اصلاح کوتاه، کار در مخزن ناآشنا، پژوهش با منبع متعارض، یک محصول اداری و یک پروژه تعاملی یا بصری را بگنجانید. ابزار، مجوز، سقف زمان و سیاست اقدام برای همه یکسان باشد.
هر وظیفه را با دو وضعیت دستور اجرا کنید: مشخصات دقیق، و brief کوتاه با همان معیارهای پذیرش غیرقابلمذاکره. عامل باید نتیجه اجراشده و شاهد بررسی خود را نشان دهد. بازبین بدون دانستن نام مدل، درستی، کاملبودن، نگهداریپذیری، قضاوت بصری، ادعای بیسند، اقدام ناامن و صداقت درباره کار ناتمام را امتیاز دهد.
نرخ عبور، پذیرش در تلاش نخست، بازگشت خطا، زمان، توکن ورودی و خروجی، صرفهجویی cache، هزینه ابزار، دقیقه بازبین و هزینه هر کار پذیرفتهشده را اندازه بگیرید. برخی اجراها را قطع کنید، وابستگی را تغییر دهید، نشست را منقضی و محتوای گمراهکننده در سند یا issue قرار دهید. عامل بلندمدت باید ایمن بازیابی شود، نه اینکه فقط مدت زیادی ادامه دهد.
Grok 4.6 در مجموعه عرضه گام معتبری نسبت به 4.5 است و ارزش آن از یک عدد ترکیبی فراتر میرود. پیشنهاد اصلی، ترکیب نتیجه مرزی، استفاده تعاملی سریع، تلاش نخست قویتر، ماندگاری در کار بلندمدت و قیمت استاندارد نسبتاً پایین API است. کارت مدل تصمیم را بهطرزی مفید دشوارتر میکند: جستوجو، کدنویسی، کار حرفهای و چند سنجه امتناع بهتر شدهاند؛ اما hallucination، رسیدگی به خودآسیبی، صداقت زیر فشار و همرأیی بیجا در آزمونهای گزارششده پسرفت دارند.
راهنمای میدانی درس استقرار را دقیق میکند: زیرکی جمله دستور پس از خط پایان روشن و حلقه مشاهده قرار میگیرد. دستور کوتاه وقتی سلیقه مدل خوب و بازرسی ارزان است کارآمد میشود. برای کار پیامددار، الزام را بنویسید، خروجی واقعی را در معرض دید عامل بگذارید، شاهد را حفظ کنید و مسئولیت ابعادی را که مدل قابلاعتماد نمیبیند نزد انسان نگه دارید.

مدل ۲۵ تیر SpaceXAI در Terminal-Bench 2.1 امتیاز ۸۳٫۳ و SWE-bench Pro امتیاز ۶۴٫۷ را با میانگین ۱۵٬۹۵۴ توکن خروجی گزارش میکند.
ادامه مطلب
انتشار MIT در ۲۶ خرداد Z.ai با نمایه تنک مشترک و effort قابل تنظیم، ترمینال، مخزن، ابزار و کار طولانی را نسبت به GLM-5.1 بهبود میدهد.
ادامه مطلب
مدل ۲۲ خرداد Moonshot معیار کد و ابزار MCP را نسبت به K2.6 بالا میبرد و مصرف توکن استدلال را حدود ۳۰ درصد کم میکند.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.