llama.cpp پیشپردازش Adreno را تا ۲۵ درصد سریعتر میکند، بیآنکه تراشه عوض شود
نسخه b10687 پروژه llama.cpp مسیر ضرب ماتریسی را برای دو نسل از پردازندههای گرافیکی Adreno کوالکام تغییر میدهد. نتیجه اعلامشده برای پیشپردازش مدل اصلی gpt-oss-20b روی Adreno X2-90 حدود ۲۵ درصد و برای Gemma 3n E4B روی Adreno 740 حدود ۹ درصد سرعت بیشتر است؛ مرحله تولید توکن تغییر نکرده است. این یک بهبود محدود و اندازهگیریشده در نرمافزار است، نه افزایش سرعت همه دستگاهها. صورتهای مالی تازه اهمیت اقتصادی ماجرا را روشن میکنند: درآمد سهماهه Marvell با رشد ۳۶٫۵ درصدی به ۲٫۷۳۹ میلیارد دلار رسید و فروش مرکز داده ۴۶ درصد بالا رفت؛ در Elastic نیز درآمد اشتراک ۱۵ درصد رشد کرد، اما هزینه آن ۳۲ درصد بالا رفت و حاشیه ناخالص اشتراک از ۸۲ به ۸۰ درصد کاهش یافت. آمار فدرال رزرو از افزایش ۳۵٫۳ میلیارد دلاری وام و اجاره بانکی در هفته منتهی به ۱۹ اوت خبر میدهد، اما سهم AI را جدا نمیکند. جمعبندی ژرف: ظرفیت بعدی AI شاید از انتخاب مسیر بهتر روی تراشه موجود به دست آید، ولی ارزش پایدار زمانی ساخته میشود که این بهبود در مدلهای بیشتر دوام بیاورد و به حاشیه سود یا جریان نقد بهتر تبدیل شود.
تحلیل ژرف
llama.cpp تراشه تازهای معرفی نکرده؛ از دو نسل موجود پردازنده گرافیکی موبایل کار بیشتری میگیرد. نسخه b10687 که ساعت ۱۸:۲۳ روز ۲۹ اوت به وقت UTC منتشر شد، مسیر ضرب ماتریسی OpenCL را برای خانوادههای Adreno X2E و A7X کوالکام تغییر میدهد. پروژه میگوید مسیر تازه روی Adreno X2-90 پیشپردازش مدل اصلی gpt-oss-20b را حدود ۲۵ درصد سریعتر میکند. روی Adreno 740 نیز کنارگذاشتن یک kernel نامناسب، برای Gemma 3n E4B حدود ۹ درصد بهبود میآورد. پیشپردازش همان کاری است که پیش از ظاهرشدن نخستین توکن انجام میشود؛ پس نتیجه برای اجرای محلی مدل محسوس است. نکته اقتصادی هم همینجاست: سرعت بیشتر از انتخاب مسیر درست و شناخت رفتار کامپایلر آمده، نه از خرید تراشه جدید.
در X2-90، kernel قبلی برای ضرب F16 در F32، نگاشتهای attention را با سرعتی نزدیک به یکچهارم مسیر بهینه q4_0 روی همان دستگاه اجرا میکرد. نسخه اصلی gpt-oss-20b نیز ۴۰٫۸ درصد از زمان GPU در مرحله پیشپردازش را در همین یک kernel میگذراند. مسیر سریعتر xmem از قبل وجود داشت، اما باید دستی فعال میشد؛ نسخه تازه آن را برای دستگاههای X2E به حالت پیشفرض میبرد. نتیجه روی Adreno 840 خنثی بود و رفتار آن تغییر نکرد. گونه q8-attention نیز از پیش مسیر دیگری داشت و سودی نمیبرد. گزارش انتشار از موفقیت ۹۶۳ آزمون ضرب ماتریسی و صفر شکست در دو شاخه آزمایش خبر میدهد.
مشکل A7X ریشه دیگری دارد. به گفته پروژه، کامپایلر قدیمی برای kernel کاشیشده F32 به ازای هر work item حدود ۴۸۸ بایت حافظه خصوصی میگیرد؛ همان کد در نسل بعدی به ۳۰۴ بایت نیاز دارد. فشار روی register باعث رفتوبرگشت داده در حلقه داخلی و افت شدید سرعت میشود. llama.cpp اکنون ضربهای دستهای F32 در F32 را روی A7X به kernel سطری میسپارد که کامپایلر بهتر اجرا میکند؛ دستههای کوچک همچنان روی مسیر قبلی میمانند. در هر دو تغییر، محل اجرای decode دستنخورده است، زیرا شرطها فقط در ابعاد بزرگتر فعال میشوند. بنابراین وعده دقیق، کاهش انتظار پیش از شروع خروجی در موارد آزمودهشده است، نه افزایش عمومی سرعت تولید همه توکنها.
این مرز برای محاسبه مالی تعیینکننده است. اگر بهبود ۲۵ درصدی در بار واقعی هم تکرار شود، میتواند زمان رسیدن به نخستین پاسخ را کم کند، تعداد درخواست تکمیلشده در هر ساعت دستگاه را بالا ببرد یا زمان تعویض سختافزار را عقب بیندازد. اما هزینه هر پاسخ لزوماً ۲۵ درصد کم نمیشود. پیشپردازش فقط بخشی از تأخیر کامل است و بارگذاری مدل، حافظه، نمونهگیری، برق، محدودیت حرارتی و زمان بیکاری باقی میماند. آزمون به مدل، نوع quantization و تراشه مشخص مربوط است و میانگین ناوگان نیست. تیم مالی باید آن را فرضیهای برای آزمون با trace تولید بداند، نه مبنایی آماده برای تغییر برنامه استهلاک.
صورت مالی Marvell که ۲۸ اوت ثبت شد، سمت فیزیکی ظرفیت AI را در مقیاسی بزرگتر نشان میدهد. درآمد فصل منتهی به ۱ اوت با رشد ۳۶٫۵ درصدی از ۲٫۰۰۶ به ۲٫۷۳۹ میلیارد دلار رسید. درآمد مرکز داده ۲٫۱۷۲ میلیارد دلار، یا ۷۹ درصد کل فروش بود؛ یک سال قبل این عدد ۱٫۴۹۱ میلیارد دلار و سهم آن ۷۴ درصد بود. شرکت افزایش ۴۶ درصدی فروش مرکز داده را عمدتاً به تقاضای مرتبط با AI نسبت میدهد. حاشیه ناخالص با جذب بهتر هزینه و ترکیب محصول ۲٫۷ واحد درصد بهتر شد و جریان نقد عملیاتی ششماهه به ۱٫۲ میلیارد دلار رسید. این اعداد تقاضا و نقدینگی در زنجیره زیرساخت را تأیید میکنند، اما میزان استفاده واقعی مشتری از ظرفیت را نمیگویند.
همان سند جلوی تعمیم شتابزده را میگیرد. یک توزیعکننده نامبردهنشده ۴۴ درصد و یک مشتری مستقیم ۱۶ درصد درآمد فصل را ساختهاند. حدود ۸۴ درصد فروش برای مشتریانی ارسال شده که در آسیا فعالیت میکنند. Marvell هشدار میدهد ساخت مراکز داده AI ممکن است با محدودیت برق و آب، مجوز، زنجیره تأمین یا مخالفت محلی عقب بیفتد و مشتری نیز میتواند سرمایه را کند یا به جای دیگری منتقل کند. هزینه تحقیقوتوسعه فصل ۴۲٫۸ درصد بالا رفت و به ۷۴۱٫۱ میلیون دلار رسید. پس رشد قوی همراه با ریسک تمرکز، اجرا و سرمایهگذاری است؛ نه یک جریان سود بیاصطکاک.
فرم 10-Q شرکت Elastic که آن هم ۲۸ اوت ثبت شد، لایه دیگری از اقتصاد AI را نشان میدهد: رشد فروش لزوماً همزمان با رشد حاشیه سود نیست. درآمد کل فصل منتهی به ۳۱ ژوئیه ۱۵ درصد افزایش یافت و به ۴۷۸٫۱ میلیون دلار رسید؛ درآمد اشتراک نیز با رشد ۱۵ درصدی ۴۴۸٫۷ میلیون دلار شد. درآمد Elastic Cloud بیست درصد بالا رفت و به ۲۳۵٫۲ میلیون دلار رسید. تعهدات عملکردی باقیمانده ۱٫۸۵۴ میلیارد دلار بود که شرکت انتظار دارد حدود ۶۲ درصد آن را در دوازده ماه آینده به درآمد تبدیل کند. جریان نقد عملیاتی هم از ۱۰۴٫۸ به ۱۳۲ میلیون دلار افزایش یافت. اینها نشانههای واقعی تقاضا و نقد برای نرمافزار جستوجو، مشاهدهپذیری و امنیت سازمانی هستند.
در سوی هزینه، تصویر سختتر است. هزینه درآمد اشتراک Elastic با رشد ۳۲ درصدی به ۹۱٫۹ میلیون دلار رسید؛ بیش از دو برابر سرعت رشد درآمد اشتراک. شرکت میگوید از افزایش ۲۲٫۵ میلیون دلاری این هزینه، ۱۶ میلیون دلار به میزبانی ابری مربوط بوده است. حاشیه ناخالص اشتراک از ۸۲ به ۸۰ درصد افت کرد. Elastic در همین فصل ۱۶٫۷ میلیون دلار زیان خالص و ۱۹٫۹ میلیون دلار هزینه بازسازی و موارد مرتبط ثبت کرد، هرچند ۱٫۴۶۱ میلیارد دلار وجه نقد، معادل نقد و اوراق قابلفروش داشت. مقایسه با اصلاح llama.cpp روشن است: نرمافزار میتواند ظرفیت بلااستفاده را پیدا کند، اما ارائهدهنده ابری همچنان هزینه ظرفیت زیربنایی را میپردازد. بهینهسازی زمانی به اقتصاد بهتر تبدیل میشود که صرفهجویی اندازهگیری و حفظ شود و رشد مصرف یا هزینه دیگری آن را نبلعد.
گزارش H.8 فدرال رزرو فقط پسزمینه اعتبار را اضافه میکند و ردیفی به نام «وام AI» نمیسازد. وام و اجاره تعدیلشده فصلی بانکهای تجاری آمریکا از ۱۳٫۹۸۱۲ تریلیون دلار در هفته منتهی به ۱۲ اوت به ۱۴٫۰۱۶۵ تریلیون دلار در هفته منتهی به ۱۹ اوت رسید؛ یعنی ۳۵٫۳ میلیارد دلار افزایش. وام تجاری و صنعتی ۱۱٫۸ میلیارد دلار بالا رفت و به ۲٫۹۴۵۷ تریلیون دلار رسید و کل اعتبار بانکی نیز ۳۳٫۷ میلیارد دلار رشد کرد. این سطوح هفتگی برآوردی، تعدیلشده و قابل بازبینیاند. آنها گسترش اعتبار در آن هفته را نشان میدهند، نه اینکه مرکز داده، سفارش تراشه یا قرارداد AI خاصی با این پول تأمین شده باشد.
آزمون عملی از اینجا ساده است. تیم دستگاه باید پیش و پس از b10687، زمان رسیدن به نخستین توکن، انرژی هر درخواست کامل، رفتار حرارتی و تعداد توکن به ازای وات را روی همان مدل و quantization مقایسه کند. سهم ترافیکی که واقعاً به مسیر تازه میرسد باید جداگانه ثبت شود و prefill با decode یکی گرفته نشود. تیم زیرساخت و مالی فقط بهبود تأییدشده در تولید را وارد برنامه ظرفیت کند و سپس ببیند رشد مصرف، صرفهجویی را پس میگیرد یا نه. در تحلیل بازار نیز درآمد تراشه، درآمد قراردادی نرمافزار و اعتبار بانکی سه سنجه جدا هستند و جمعکردن آنها یک عدد معتبر برای هزینه AI نمیسازد.
نشانههای بعدی مشخصاند: آزمون روی دستگاههای بیشتر X2E و A7X، مدلهای دیگر، promptهای بلند و بار حرارتی پایدار؛ گزارش بازگشت خطا پس از پیشفرضشدن xmem؛ و انتقال همین نوع انتخاب آگاه از کامپایلر به backendهای دیگر. در صورتهای مالی نیز تمرکز مشتری، ترکیب فروش مرکز داده و تبدیل سود به نقد در Marvell باید کنار رشد هزینه میزبانی و حاشیه اشتراک Elastic دیده شود. نتیجه امروز محدود اما قابلاستفاده است: بخشی معنادار از ظرفیت AI ممکن است در انتخاب نرمافزاری روی سختافزاری پنهان باشد که پولش قبلاً پرداخت شده است. پیداکردن این ظرفیت ارزش دارد؛ اثبات گستردگی آن و نگهداشتن منفعت اقتصادی، بخش دشوارتر کار است.
منابع و اسناد
- 01Release b10687llama.cpp · ۷ شهریور ۱۴۰۵
- 02opencl: use a better matmul path on two Adreno GPU generationsllama.cpp · ۷ شهریور ۱۴۰۵
- 03Quarterly report for the quarter ended August 1, 2026Marvell Technology · ۶ شهریور ۱۴۰۵
- 04Quarterly report for the quarter ended July 31, 2026U.S. Securities and Exchange Commission · ۶ شهریور ۱۴۰۵
- 05Assets and Liabilities of Commercial Banks in the United States — H.8Federal Reserve Board · ۶ شهریور ۱۴۰۵
برچسبها
اخبار مرتبط

لاما سیپلاسپلاس با ادغام محاسبات، بعضی آزمونهای مک را سریعتر کرد
توسعهدهندگان لاما سیپلاسپلاس در ۱۹ سپتامبر مجموعهای از تغییرات اجرای مدل روی پردازندههای گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارششده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغامهای مشخص است، نه سریعتر شدن همه مدلها یا اثبات کاهش هزینه. اصلاح جداگانهای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یکساله مصرفکنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایتهای ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دستکم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایهگذاری کنند. این برنامه، هزینه انجامشده یا تضمین ایمنی نیست. همزمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا میشود. تحلیل ژرف توضیح میدهد چرا دسترسی ارزیاب، اختیار تصمیمگیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریعتر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
گوگل، انویدیا و امرالد ایآی ائتلافی ساختهاند که میخواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویلشده یا قاعده الزامآور نیست. ژرف بررسی میکند چنین وعدهای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کمکردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمیکند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یکچهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیمگر، عملکرد اندازهگیریشده و مسئولیت روشن هزینهها، معیارهای بعدیاند؛ نه صرف حمایت شرکتها.