لاما سیپلاسپلاس با ادغام محاسبات، بعضی آزمونهای مک را سریعتر کرد

توسعهدهندگان لاما سیپلاسپلاس در ۱۹ سپتامبر مجموعهای از تغییرات اجرای مدل روی پردازندههای گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارششده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغامهای مشخص است، نه سریعتر شدن همه مدلها یا اثبات کاهش هزینه. اصلاح جداگانهای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یکساله مصرفکنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایتهای ایالتی را محدود کرد.
تحلیل ژرف
لاما سیپلاسپلاس در ۱۹ سپتامبر بهینهسازیهای تازهای را برای اجرای مدلها با متال، مسیر پردازش گرافیکی اپل، وارد کد اصلی کرد. تغییر شماره ۲۸۹۴۸ بعضی عملیات پیاپی را در یک نوبت اجرا میکند تا رفتوبرگشتهای اضافی حذف شوند. نتیجه در جدول آزمون توسعهدهنده مثبت است، اما برای همه مدلها یکسان نیست. نکته مهمتر در سابقه همین تغییر دیده میشود: یک ادغام دیگر سرعت را پایین آورد و پیش از ادغام نهایی کنار گذاشته شد. بنابراین خبر امروز هم افزایش سرعت در آزمونهای مشخص است و هم نمونهای روشن از اینکه کوتاهتر کردن فهرست عملیات، لزوماً کار را زودتر تمام نمیکند.
جدول همراه تغییر، نسخه آزمایشی را با نسخه پایه b10809 مقایسه میکند. برای ردیف qwen35moe 35B.A3B با قالب Q4_K_M روی M2 Ultra، تولید ۳۲ توکن از ۹۰٫۲۶ به ۱۰۴٫۸۷ توکن در ثانیه رسید؛ حدود ۱۶ درصد افزایش. پردازش ورودی ۲۰۴۸ توکنی همان ردیف از ۲۳۰۹٫۴۶ به ۲۴۱۵٫۵۷ رسید، یعنی نزدیک ۵ درصد. روی M5 Max، آزمون تولید ۱۲۸ توکن از ۱۰۴٫۷۰ به ۱۱۷٫۷۵ رسید، حدود ۱۲ درصد. در مقابل، پردازش ورودی مدل ۲۷ میلیاردی Q4_K_M روی M2 Ultra تقریباً ثابت بود: ۳۶۶٫۶۴ در برابر ۳۶۷٫۰۹. اینها نتایج گزارششده توسعهدهندهاند و ژرف آنها را مستقلاً بازتولید نکرده است؛ حتی طول آزمون تولید متن در دو دستگاه متفاوت است.
ادغام ناموفق، محاسبه ضرب ماتریسبردار و تابع فعالسازی را به هم چسبانده بود. در توضیح ثبتشده، سرعت تولید متن برای Qwen3.6-35B-A3B از ۸۸٫۵ به ۸۱٫۵ توکن در ثانیه افت کرد؛ حدود ۸ درصد کاهش. علت اعلامشده این بود که عملیات جداگانه قبلاً میتوانستند همزمان با کار دیگری اجرا شوند، اما ادغام، آنها را پشت سر هم قرار میداد. این افت مربوط به گزینه کنارگذاشتهشده است، نه نتیجه نهایی بهروزرسانی. نام مدل در این توضیح نیز با برچسب جدول یکسان نیست؛ نباید دو آزمون را یک آزمایش واحد معرفی کرد. اتفاق تازه، ورود تغییر نهایی به کد اصلی است، نه عرضه مدل تازه یا انتشار اولیه درخواست تغییر.
برداشت ژرف برای تیمی که مدل را روی مک اجرا میکند، از همین اختلافها شروع میشود. فرض کنید کار یک برنامه، خواندن سند بلند و نوشتن پاسخی کوتاه باشد. افزایش سرعت مرحله تولید متن الزاماً به همان نسبت زمان کل پاسخ را کم نمیکند؛ بخش بزرگی از انتظار ممکن است صرف خواندن ورودی، جستوجوی سند یا ابزار جانبی شود. برعکس، در نوشتن پاسخهای بلند، سهم تولید متن بیشتر است. برای سنجش سود این تغییر باید همان مدل، قالب فشردهسازی و طول ورودی واقعی را مقایسه کرد. این مثال یک کاربرد فرضی است، نه آزمونی منتشرشده درباره اسناد فارسی یا تضمینی برای همه نرمافزارهای مک.
اصلاح دیگری که ۱۹ سپتامبر وارد لاما سیپلاسپلاس شد، نشان میدهد هزینه اجرای درست را هم باید حساب کرد. تغییر شماره ۲۸۳۸۹ در مسیر کودا، حافظه ورودی و خروجی مرتبسازی CUB را جدا میکند؛ استفاده مشترک میتوانست داده ورودی را هنگام کار خراب کند و شاخصهای نامعتبر بسازد. گزارش خطا مربوط به مسیری روی سختافزار Maxwell با CUDA 12.5 و CCCL 2.x بود، نه همه درخواستهای معمول. در نتیجه، کاهش تعداد خطاها یا اجرای دوباره میتواند برای چنین بار کاری مهمتر از رکورد سرعت باشد. این اصلاح را نباید خبر نفوذ امنیتی، خرابی همه کارتهای انویدیا یا حل همه مشکلات دقت مدل دانست.
برای تصمیم مالی نیز هنوز یک فاصله باقی است: توکن بیشتر در ثانیه، بهتنهایی صورتحساب پایینتر نیست. جدول متال مصرف برق، زمان بازبینی پاسخ یا هزینه استقرار را اندازه نمیگیرد. اگر دستگاه از قبل خریداری شده باشد، سود احتمالی میتواند آزاد شدن وقت همان دستگاه باشد؛ اگر برنامه منتظر پاسخ ابزار دیگری بماند، این ظرفیت اضافه شاید استفاده نشود. از نظر ژرف، مقایسه معنادار برای همین بهروزرسانی، زمان و هزینه هر کار تمامشده و قابلقبول است. اندازهگیری توان مصرفی و تعداد پاسخهای نیازمند تکرار میتواند روشن کند شتاب مرحله محاسبه چقدر به آن نتیجه منتقل شده است؛ داده فعلی پاسخ آمادهای برای این پرسش ندارد.
گزارشهای اقتصادی جمعه، ۱۸ سپتامبر، موضوعی جدا از این آزمون نرمافزاریاند. فدرال رزرو اعلام کرد تولید صنعتی آمریکا در اوت پس از رشد ۰٫۲ درصدی ژوئیه بدون تغییر ماند؛ تولید کارخانهای ۰٫۳ درصد کاهش یافت و تولید برق و گاز ۱٫۸ درصد بالا رفت. نرخ استفاده از ظرفیت صنعتی ۷۶٫۳ درصد بود، یعنی ۳٫۱ واحد درصد پایینتر از میانگین بلندمدت ۱۹۷۲ تا ۲۰۲۵. ارقام اوت مقدماتی و تعدیلشده فصلیاند. برای فروشنده تجهیزات یا نرمافزار صنعتی، تفکیک اجزای این گزارش مهم است: ثبات عدد کل، به معنای ثبات وضع کارخانهها نیست. این شاخص هم اندازه تولید ناخالص داخلی یا ظرفیت آماده استفاده برای هوش مصنوعی نیست.
بانک مرکزی اروپا نیز نتایج نظرسنجی اوت را منتشر کرد: میانه انتظار تورم یکسال آینده از ۲٫۹ به ۳ درصد رسید، در حالی که انتظار رشد درآمد اسمی ۱ درصد و انتظار رشد مخارج اسمی ۳٫۶ درصد باقی ماند. برداشت ژرف این است که انتظار افزایش قیمتها را نباید با آمادگی بیشتر خانوار برای خرید یکی گرفت. این داده، انتظار پاسخدهندگان است، نه تورم تحققیافته یا پیشبینی رسمی بانک مرکزی. پاسخها بین ۶ تا ۲۴ اوت جمعآوری شدهاند و نمیتوان آنها را واکنش به اخبار سپتامبر دانست. سنجه درآمد و مخارج نیز همان میانه تورمی نیست. برای کسبوکار مصرفی، این تفاوت مانع از آن میشود که یک عدد تورم جای ارزیابی تقاضا بنشیند.
در سمت عرضه زیرساخت، ابیگیل اسپنبرگر، فرماندار ویرجینیا، در ۱۸ سپتامبر فرمان اجرایی ۲۲ را امضا کرد. این فرمان از همان زمان، نهاد توسعه اقتصادی ایالت را از کمک به مراکز داده جدید با تقاضای اوج پیشبینیشده ۲۵ مگاوات یا بیشتر، از مسیر برنامه آمادهسازی زمین، صدور سریع مجوز و برنامههای اختیاری مشابه منع میکند. این حکم ممنوعیت ساخت همه مراکز داده نیست. از نگاه ژرف، توسعهدهندهای که زمانبندی پروژه را بر دریافت چنین کمکی بنا کرده، باید آن فرض را دوباره بررسی کند؛ داشتن زمین یا سفارش تجهیزات، جای مسیر مجاز توسعه را نمیگیرد. این محدودیت مشخص را هم نمیتوان به همه ایالتها یا پروژههای موجود تعمیم داد.
فرمان، توافقهای محرمانگی آینده دستگاههای اجرایی درباره اطلاعات مهم این پروژهها را نیز محدود میکند، اما حفظ تعهدات و توافقهای موجود و استثناهای فوقالعاده مانند امنیت ملی را تصریح کرده است. همه اجزای چارچوب همان روز اجرایی نمیشوند: ابزار راهنمای مشارکت محلی ظرف ۱۲۰ روز و پیشنهاد معیارها و برنامه اجرای VA-LEAD تا پایان ۲۰۲۷ موعد دارند. درخواست مذاکره برای تقسیم منصفانه هزینه شبکه هم معادل تصویب یک تعرفه نهایی نیست. به تحلیل ژرف، در بودجه پروژه باید کمک حذفشده امروز را از هزینهای که هنوز قاعده قطعی ندارد جدا کرد. بهینهسازی روی یک مک نیز جایگزین مجوز یا اتصال برق یک مرکز داده بزرگ نیست.
در ادامه باید دید نتایج متال روی بارهای کاری دیگر تکرار میشود یا نه، و ابزارهایی که از لاما سیپلاسپلاس استفاده میکنند چه زمانی این تغییر را وارد نسخه خود میکنند. برای مسیر کودای درگیر خطا، پایداری اجرای کامل مهمتر از تعمیم یک عدد سرعت است. در اقتصاد، انتشار بعدی نظرسنجی اروپا در ۲۳ اکتبر و بازنگری صنعتی آمریکا در ۲۴ نوامبر به روشنتر شدن تصویر کمک میکنند؛ در ویرجینیا، جزئیات اجرای فرمان تعیینکنندهاند. جمعبندی ژرف درباره خبر اصلی محدود و روشن است: ادغام گزینشی در آزمونهای مشخص سود داده، اما ارزش اقتصادی آن فقط با کار درست و کامل سنجیده میشود، نه با تعداد عملیات حذفشده.
منابع و اسناد
- 01metal : add MoE and SSM_CONV fusion optimizations (#28948)ggml-org · ۲۸ شهریور ۱۴۰۵
- 02cuda : fix CUB argsort corruption caused by in-place keys (#28389)ggml-org · ۲۸ شهریور ۱۴۰۵
- 03Industrial Production and Capacity UtilizationFederal Reserve Board · ۲۷ شهریور ۱۴۰۵
- 04ECB Consumer Expectations Survey results – August 2026European Central Bank · ۲۷ شهریور ۱۴۰۵
- 05Executive Order 22 (2026): Establishing New Nation-Leading Standards and Initiatives to Implement the Virginia Data Center Accountability Framework and Responding to Unprecedented Risk From Artificial IntelligenceGovernor of Virginia · ۲۷ شهریور ۱۴۰۵
برچسبها
اخبار مرتبط

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دستکم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایهگذاری کنند. این برنامه، هزینه انجامشده یا تضمین ایمنی نیست. همزمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا میشود. تحلیل ژرف توضیح میدهد چرا دسترسی ارزیاب، اختیار تصمیمگیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریعتر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
گوگل، انویدیا و امرالد ایآی ائتلافی ساختهاند که میخواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویلشده یا قاعده الزامآور نیست. ژرف بررسی میکند چنین وعدهای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کمکردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمیکند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یکچهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیمگر، عملکرد اندازهگیریشده و مسئولیت روشن هزینهها، معیارهای بعدیاند؛ نه صرف حمایت شرکتها.

لیکوئید کامپیوت برای ساخت بازار آتی توان پردازشی ۱۵ میلیون دلار جذب کرد
لیکوئید کامپیوت روز ۱۵ سپتامبر از جذب ۱۵ میلیون دلار برای ساخت بازار توان پردازشی خبر داد؛ درخواستهای مجوز آن نزد نهاد ناظر آمریکا هنوز در دست بررسی است. پرسش اصلی فقط تأمین سرمایه نیست: چه چیزی دو واحد ظرفیت هوش مصنوعی را آنقدر شبیه میکند که بتوان برایشان قرارداد مشترک نوشت؟ عرضه تراشه اروپای اکسلرا و نمایش اجرای نرمافزار AMD روی میزبان ریسکپنج، تفاوت دستگاههای پشت این بازار را نشان میدهد. ژرف توضیح میدهد چرا فرصت فروش با درآمد فرق دارد، نتیجه آزمون فروشنده معادل کاهش قبض مشتری نیست و تسویه نقدی هم دستگاهی را برای خریدار رزرو نمیکند. تصمیم ناظر، تعریف روشن قرارداد و شاهد معامله قابلاجرا، قدمهای بعدیاند.