۸ شهریور ۱۴۰۵

llama.cpp پیش‌پردازش Adreno را تا ۲۵ درصد سریع‌تر می‌کند، بی‌آنکه تراشه عوض شود

llama.cpp پیش‌پردازش Adreno را تا ۲۵ درصد سریع‌تر می‌کند، بی‌آنکه تراشه عوض شود

نسخه b10687 پروژه llama.cpp مسیر ضرب ماتریسی را برای دو نسل از پردازنده‌های گرافیکی Adreno کوالکام تغییر می‌دهد. نتیجه اعلام‌شده برای پیش‌پردازش مدل اصلی gpt-oss-20b روی Adreno X2-90 حدود ۲۵ درصد و برای Gemma 3n E4B روی Adreno 740 حدود ۹ درصد سرعت بیشتر است؛ مرحله تولید توکن تغییر نکرده است. این یک بهبود محدود و اندازه‌گیری‌شده در نرم‌افزار است، نه افزایش سرعت همه دستگاه‌ها. صورت‌های مالی تازه اهمیت اقتصادی ماجرا را روشن می‌کنند: درآمد سه‌ماهه Marvell با رشد ۳۶٫۵ درصدی به ۲٫۷۳۹ میلیارد دلار رسید و فروش مرکز داده ۴۶ درصد بالا رفت؛ در Elastic نیز درآمد اشتراک ۱۵ درصد رشد کرد، اما هزینه آن ۳۲ درصد بالا رفت و حاشیه ناخالص اشتراک از ۸۲ به ۸۰ درصد کاهش یافت. آمار فدرال رزرو از افزایش ۳۵٫۳ میلیارد دلاری وام و اجاره بانکی در هفته منتهی به ۱۹ اوت خبر می‌دهد، اما سهم AI را جدا نمی‌کند. جمع‌بندی ژرف: ظرفیت بعدی AI شاید از انتخاب مسیر بهتر روی تراشه موجود به دست آید، ولی ارزش پایدار زمانی ساخته می‌شود که این بهبود در مدل‌های بیشتر دوام بیاورد و به حاشیه سود یا جریان نقد بهتر تبدیل شود.


تحلیل ژرف

llama.cpp تراشه تازه‌ای معرفی نکرده؛ از دو نسل موجود پردازنده گرافیکی موبایل کار بیشتری می‌گیرد. نسخه b10687 که ساعت ۱۸:۲۳ روز ۲۹ اوت به وقت UTC منتشر شد، مسیر ضرب ماتریسی OpenCL را برای خانواده‌های Adreno X2E و A7X کوالکام تغییر می‌دهد. پروژه می‌گوید مسیر تازه روی Adreno X2-90 پیش‌پردازش مدل اصلی gpt-oss-20b را حدود ۲۵ درصد سریع‌تر می‌کند. روی Adreno 740 نیز کنارگذاشتن یک kernel نامناسب، برای Gemma 3n E4B حدود ۹ درصد بهبود می‌آورد. پیش‌پردازش همان کاری است که پیش از ظاهرشدن نخستین توکن انجام می‌شود؛ پس نتیجه برای اجرای محلی مدل محسوس است. نکته اقتصادی هم همین‌جاست: سرعت بیشتر از انتخاب مسیر درست و شناخت رفتار کامپایلر آمده، نه از خرید تراشه جدید.

در X2-90، kernel قبلی برای ضرب F16 در F32، نگاشت‌های attention را با سرعتی نزدیک به یک‌چهارم مسیر بهینه q4_0 روی همان دستگاه اجرا می‌کرد. نسخه اصلی gpt-oss-20b نیز ۴۰٫۸ درصد از زمان GPU در مرحله پیش‌پردازش را در همین یک kernel می‌گذراند. مسیر سریع‌تر xmem از قبل وجود داشت، اما باید دستی فعال می‌شد؛ نسخه تازه آن را برای دستگاه‌های X2E به حالت پیش‌فرض می‌برد. نتیجه روی Adreno 840 خنثی بود و رفتار آن تغییر نکرد. گونه q8-attention نیز از پیش مسیر دیگری داشت و سودی نمی‌برد. گزارش انتشار از موفقیت ۹۶۳ آزمون ضرب ماتریسی و صفر شکست در دو شاخه آزمایش خبر می‌دهد.

مشکل A7X ریشه دیگری دارد. به گفته پروژه، کامپایلر قدیمی برای kernel کاشی‌شده F32 به ازای هر work item حدود ۴۸۸ بایت حافظه خصوصی می‌گیرد؛ همان کد در نسل بعدی به ۳۰۴ بایت نیاز دارد. فشار روی register باعث رفت‌وبرگشت داده در حلقه داخلی و افت شدید سرعت می‌شود. llama.cpp اکنون ضرب‌های دسته‌ای F32 در F32 را روی A7X به kernel سطری می‌سپارد که کامپایلر بهتر اجرا می‌کند؛ دسته‌های کوچک همچنان روی مسیر قبلی می‌مانند. در هر دو تغییر، محل اجرای decode دست‌نخورده است، زیرا شرط‌ها فقط در ابعاد بزرگ‌تر فعال می‌شوند. بنابراین وعده دقیق، کاهش انتظار پیش از شروع خروجی در موارد آزموده‌شده است، نه افزایش عمومی سرعت تولید همه توکن‌ها.

این مرز برای محاسبه مالی تعیین‌کننده است. اگر بهبود ۲۵ درصدی در بار واقعی هم تکرار شود، می‌تواند زمان رسیدن به نخستین پاسخ را کم کند، تعداد درخواست تکمیل‌شده در هر ساعت دستگاه را بالا ببرد یا زمان تعویض سخت‌افزار را عقب بیندازد. اما هزینه هر پاسخ لزوماً ۲۵ درصد کم نمی‌شود. پیش‌پردازش فقط بخشی از تأخیر کامل است و بارگذاری مدل، حافظه، نمونه‌گیری، برق، محدودیت حرارتی و زمان بیکاری باقی می‌ماند. آزمون به مدل، نوع quantization و تراشه مشخص مربوط است و میانگین ناوگان نیست. تیم مالی باید آن را فرضیه‌ای برای آزمون با trace تولید بداند، نه مبنایی آماده برای تغییر برنامه استهلاک.

صورت مالی Marvell که ۲۸ اوت ثبت شد، سمت فیزیکی ظرفیت AI را در مقیاسی بزرگ‌تر نشان می‌دهد. درآمد فصل منتهی به ۱ اوت با رشد ۳۶٫۵ درصدی از ۲٫۰۰۶ به ۲٫۷۳۹ میلیارد دلار رسید. درآمد مرکز داده ۲٫۱۷۲ میلیارد دلار، یا ۷۹ درصد کل فروش بود؛ یک سال قبل این عدد ۱٫۴۹۱ میلیارد دلار و سهم آن ۷۴ درصد بود. شرکت افزایش ۴۶ درصدی فروش مرکز داده را عمدتاً به تقاضای مرتبط با AI نسبت می‌دهد. حاشیه ناخالص با جذب بهتر هزینه و ترکیب محصول ۲٫۷ واحد درصد بهتر شد و جریان نقد عملیاتی شش‌ماهه به ۱٫۲ میلیارد دلار رسید. این اعداد تقاضا و نقدینگی در زنجیره زیرساخت را تأیید می‌کنند، اما میزان استفاده واقعی مشتری از ظرفیت را نمی‌گویند.

همان سند جلوی تعمیم شتاب‌زده را می‌گیرد. یک توزیع‌کننده نام‌برده‌نشده ۴۴ درصد و یک مشتری مستقیم ۱۶ درصد درآمد فصل را ساخته‌اند. حدود ۸۴ درصد فروش برای مشتریانی ارسال شده که در آسیا فعالیت می‌کنند. Marvell هشدار می‌دهد ساخت مراکز داده AI ممکن است با محدودیت برق و آب، مجوز، زنجیره تأمین یا مخالفت محلی عقب بیفتد و مشتری نیز می‌تواند سرمایه را کند یا به جای دیگری منتقل کند. هزینه تحقیق‌وتوسعه فصل ۴۲٫۸ درصد بالا رفت و به ۷۴۱٫۱ میلیون دلار رسید. پس رشد قوی همراه با ریسک تمرکز، اجرا و سرمایه‌گذاری است؛ نه یک جریان سود بی‌اصطکاک.

فرم 10-Q شرکت Elastic که آن هم ۲۸ اوت ثبت شد، لایه دیگری از اقتصاد AI را نشان می‌دهد: رشد فروش لزوماً هم‌زمان با رشد حاشیه سود نیست. درآمد کل فصل منتهی به ۳۱ ژوئیه ۱۵ درصد افزایش یافت و به ۴۷۸٫۱ میلیون دلار رسید؛ درآمد اشتراک نیز با رشد ۱۵ درصدی ۴۴۸٫۷ میلیون دلار شد. درآمد Elastic Cloud بیست درصد بالا رفت و به ۲۳۵٫۲ میلیون دلار رسید. تعهدات عملکردی باقیمانده ۱٫۸۵۴ میلیارد دلار بود که شرکت انتظار دارد حدود ۶۲ درصد آن را در دوازده ماه آینده به درآمد تبدیل کند. جریان نقد عملیاتی هم از ۱۰۴٫۸ به ۱۳۲ میلیون دلار افزایش یافت. این‌ها نشانه‌های واقعی تقاضا و نقد برای نرم‌افزار جست‌وجو، مشاهده‌پذیری و امنیت سازمانی هستند.

در سوی هزینه، تصویر سخت‌تر است. هزینه درآمد اشتراک Elastic با رشد ۳۲ درصدی به ۹۱٫۹ میلیون دلار رسید؛ بیش از دو برابر سرعت رشد درآمد اشتراک. شرکت می‌گوید از افزایش ۲۲٫۵ میلیون دلاری این هزینه، ۱۶ میلیون دلار به میزبانی ابری مربوط بوده است. حاشیه ناخالص اشتراک از ۸۲ به ۸۰ درصد افت کرد. Elastic در همین فصل ۱۶٫۷ میلیون دلار زیان خالص و ۱۹٫۹ میلیون دلار هزینه بازسازی و موارد مرتبط ثبت کرد، هرچند ۱٫۴۶۱ میلیارد دلار وجه نقد، معادل نقد و اوراق قابل‌فروش داشت. مقایسه با اصلاح llama.cpp روشن است: نرم‌افزار می‌تواند ظرفیت بلااستفاده را پیدا کند، اما ارائه‌دهنده ابری همچنان هزینه ظرفیت زیربنایی را می‌پردازد. بهینه‌سازی زمانی به اقتصاد بهتر تبدیل می‌شود که صرفه‌جویی اندازه‌گیری و حفظ شود و رشد مصرف یا هزینه دیگری آن را نبلعد.

گزارش H.8 فدرال رزرو فقط پس‌زمینه اعتبار را اضافه می‌کند و ردیفی به نام «وام AI» نمی‌سازد. وام و اجاره تعدیل‌شده فصلی بانک‌های تجاری آمریکا از ۱۳٫۹۸۱۲ تریلیون دلار در هفته منتهی به ۱۲ اوت به ۱۴٫۰۱۶۵ تریلیون دلار در هفته منتهی به ۱۹ اوت رسید؛ یعنی ۳۵٫۳ میلیارد دلار افزایش. وام تجاری و صنعتی ۱۱٫۸ میلیارد دلار بالا رفت و به ۲٫۹۴۵۷ تریلیون دلار رسید و کل اعتبار بانکی نیز ۳۳٫۷ میلیارد دلار رشد کرد. این سطوح هفتگی برآوردی، تعدیل‌شده و قابل بازبینی‌اند. آن‌ها گسترش اعتبار در آن هفته را نشان می‌دهند، نه اینکه مرکز داده، سفارش تراشه یا قرارداد AI خاصی با این پول تأمین شده باشد.

آزمون عملی از اینجا ساده است. تیم دستگاه باید پیش و پس از b10687، زمان رسیدن به نخستین توکن، انرژی هر درخواست کامل، رفتار حرارتی و تعداد توکن به ازای وات را روی همان مدل و quantization مقایسه کند. سهم ترافیکی که واقعاً به مسیر تازه می‌رسد باید جداگانه ثبت شود و prefill با decode یکی گرفته نشود. تیم زیرساخت و مالی فقط بهبود تأییدشده در تولید را وارد برنامه ظرفیت کند و سپس ببیند رشد مصرف، صرفه‌جویی را پس می‌گیرد یا نه. در تحلیل بازار نیز درآمد تراشه، درآمد قراردادی نرم‌افزار و اعتبار بانکی سه سنجه جدا هستند و جمع‌کردن آن‌ها یک عدد معتبر برای هزینه AI نمی‌سازد.

نشانه‌های بعدی مشخص‌اند: آزمون روی دستگاه‌های بیشتر X2E و A7X، مدل‌های دیگر، promptهای بلند و بار حرارتی پایدار؛ گزارش بازگشت خطا پس از پیش‌فرض‌شدن xmem؛ و انتقال همین نوع انتخاب آگاه از کامپایلر به backendهای دیگر. در صورت‌های مالی نیز تمرکز مشتری، ترکیب فروش مرکز داده و تبدیل سود به نقد در Marvell باید کنار رشد هزینه میزبانی و حاشیه اشتراک Elastic دیده شود. نتیجه امروز محدود اما قابل‌استفاده است: بخشی معنادار از ظرفیت AI ممکن است در انتخاب نرم‌افزاری روی سخت‌افزاری پنهان باشد که پولش قبلاً پرداخت شده است. پیداکردن این ظرفیت ارزش دارد؛ اثبات گستردگی آن و نگه‌داشتن منفعت اقتصادی، بخش دشوارتر کار است.


منابع و اسناد

  1. 01Release b10687llama.cpp · ۷ شهریور ۱۴۰۵
  2. 02opencl: use a better matmul path on two Adreno GPU generationsllama.cpp · ۷ شهریور ۱۴۰۵
  3. 03Quarterly report for the quarter ended August 1, 2026Marvell Technology · ۶ شهریور ۱۴۰۵
  4. 04Quarterly report for the quarter ended July 31, 2026U.S. Securities and Exchange Commission · ۶ شهریور ۱۴۰۵
  5. 05Assets and Liabilities of Commercial Banks in the United States — H.8Federal Reserve Board · ۶ شهریور ۱۴۰۵

برچسب‌ها

پروژه llama.cppپردازنده Adrenoهوش مصنوعی محلیبهینه‌سازی استنتاجنیمه‌رسانااقتصاد رایانش ابرینرم‌افزار سازمانیاعتبار بانکی

اخبار مرتبط

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
۲۶ شهریور ۱۴۰۵منبع: NVIDIA

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند

گوگل، انویدیا و امرالد ای‌آی ائتلافی ساخته‌اند که می‌خواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویل‌شده یا قاعده الزام‌آور نیست. ژرف بررسی می‌کند چنین وعده‌ای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کم‌کردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمی‌کند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یک‌چهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیم‌گر، عملکرد اندازه‌گیری‌شده و مسئولیت روشن هزینه‌ها، معیارهای بعدی‌اند؛ نه صرف حمایت شرکت‌ها.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما