llama.cpp با حذف جستوجوی زائد، یک آزمون متن بلند را ۵۱ درصد سریعتر میکند

نسخه b10707 پروژه llama.cpp پس از پیداکردن همه توالیهای واقعی یک خانه KV-cache، جستوجوی n-gram را متوقف میکند؛ پیش از این، مسیر کد میتوانست هر ۲۵۶ جایگاه ممکن را بررسی کند. در آزمون گزارششده با RTX PRO 6000 و نسخه quantized مدل Qwen3.8-Flash-Next، سرعت تولید در متن ۱۳۲ هزار توکنی از ۳۳٫۶ به ۵۰٫۹ توکن در ثانیه رسید؛ یعنی ۵۱٫۵ درصد بهبود در همان آزمون، بدون تغییر سرعت پردازش prompt. اصلاح جداگانه CUDA نیز پیشپردازش یک آزمون ۵۵ هزار توکنی را ۹٫۹ درصد بالا برد. این اعداد، سنجش پروژهاند و کاهش قطعی هزینه یک ناوگان نیستند. شاخص مدیران خرید اوت چین، آزمون مالی و تقاضای ماجراست: تولید صنعتی به ۴۹٫۸ و تولید پیشرفته به ۵۲٫۹ رسید، اما شاخص ترکیبی در ۴۹٫۵ زیر مرز رشد ماند. قیمت نهاده ۵۶٫۶ بود و قیمت خروجی کارخانه فقط به ۵۰٫۴ رسید؛ پس بهرهوری نرمافزار برای حاشیه سود مهم است، ولی بهتنهایی تقاضای قویتر را ثابت نمیکند.
تحلیل ژرف
نسخه b10707 پروژه llama.cpp در نخستین ساعات ۳۱ اوت یک کار تکراری را از مسیر تولید متن بلند کنار گذاشت. جستوجوی n-gram که در speculative decoding استفاده میشود، برای هر خانه پُر KV-cache تا ۲۵۶ جایگاه ممکن توالی را میگشت؛ در حالی که معمولاً همان خانه فقط به یک توالی تعلق دارد. اصلاح شماره 28011 توالیهای واقعاً موجود را میشمارد و بهمحض دیدن همه آنها، جستوجو را پایان میدهد. ترتیب پیمایش و رفتار callback عوض نشده است؛ مدل پاسخ دیگری تولید نمیکند، فقط دیگر مجبور نیست فهرست خالی را تا انتها بخواند.
اثر گزارششده بزرگ است، اما دامنه آن باید همانقدر دقیق بماند. آزمون روی RTX PRO 6000، با flash attention و نسخه UD-Q4_K_XL مدل Qwen3.8-Flash-Next انجام شده است. در متن ۵۵ هزار توکنی، سرعت تولید از ۵۶٫۳ به ۷۴٫۳ توکن در ثانیه رسید؛ ۳۲ درصد بیشتر. در ۱۳۲ هزار توکن، عدد از ۳۳٫۶ به ۵۰٫۹ رسید؛ یعنی ۵۱٫۵ درصد. سرعت پردازش prompt تغییر نکرد. هرچه خانههای بیشتری از KV-cache پُر شود، حذف جستوجوی زائد اثر بیشتری دارد و به گفته نویسنده اصلاح، در prompt کوتاه تقریباً دیده نمیشود. پس با یک سنجش گرم پروژه روی یک GPU، یک مدل و یک نوع quantization روبهرو هستیم، نه مطالعه مستقل ناوگان و نه وعده سرعت ۵۱ درصدی برای همه بارها.
نسخه b10704 در همین چرخه ۴۸ ساعته، گلوگاه دیگری را در مرحله پیشپردازش هدف گرفت. مسیر سریع CUDA برای گروهبندی expertها قبلاً تعدادهایی را میپذیرفت که ۳۲ lane یک warp بر آنها بخشپذیر باشد و برای عدد شش هم استثنا داشت. Qwen3.8-Flash-Next ده expert دارد و به همین دلیل به kernel کندتر میافتاد. کد تازه اندازه گروه را تا توان بعدی عدد دو پُر میکند، ولی همچنان همان ده expert را اجرا میکند. در سنجش اصلاحشده نویسنده روی همان RTX PRO 6000 و متن ۵۵ هزار توکنی، سرعت پردازش prompt از ۲٬۱۳۹ به ۲٬۳۵۱ توکن در ثانیه رسید؛ ۹٫۹ درصد رشد. سرعت تولید تغییر نکرد و مسیر فقط روی warpهای ۳۲-lane CUDA آزموده شده است.
این دو درصد را نباید با هم جمع کرد. اصلاح نخست، اسکن توالی را هنگام تولید کم میکند؛ اصلاح دوم، expertها را هنگام خواندن prompt بهتر مسیردهی میکند. هیچکدام هنوز مصرف برق، همزمانی درخواستهای واقعی، تأخیر دنباله توزیع یا هزینه کامل سرویس را اندازه نگرفتهاند. پیام عملی محدودتر اما مهم است: نرمافزار میتواند روی همان شتابدهنده نصبشده، کار مفید بیشتری در هر ساعت GPU تحویل دهد. برنامهریز ظرفیت پیش از ثبت این عدد در بودجه باید آن را روی مدل، توزیع طول متن و سیاست batch خود تکرار کند.
شاخص مدیران خرید اوت چین که اداره ملی آمار در ۳۱ اوت منتشر کرد، سمت تقاضا و مالی را به بحث اضافه میکند. PMI تولیدی با ۰٫۶ واحد رشد به ۴۹٫۸ رسید و هنوز زیر مرز ۵۰ ماند. شاخص تولید ۵۰٫۴ و سفارش جدید ۵۰٫۶ بود؛ سفارش صادراتی نیز ۵۰٫۱ ثبت شد. بنگاههای بزرگ با ۵۰٫۶ به محدوده رشد برگشتند، اما متوسطها در ۴۹٫۴ و کوچکها در ۴۷٫۹ ماندند. بهبود آنقدر گسترده است که مهم باشد، ولی هنوز نمیتوان کل بخش تولید را در حال رشد نامید.
شکاف قیمتها برای حاشیه سود مهمتر است. شاخص قیمت نهاده با ۳٫۴ واحد رشد به ۵۶٫۶ جهش کرد؛ قیمت خروجی کارخانه ۲٫۶ واحد بالا رفت و به ۵۰٫۴ رسید. تفسیر رسمی بخشی از این حرکت را به افزایش قیمت نفت خام و فلزات غیرآهنی نسبت میدهد و در ذوب و فرآوری فلزات غیرآهنی، هر دو شاخص قیمت بالای ۶۰ بودهاند. وقتی هزینه نهاده از سطح بالاتری و سریعتر از قیمت فروش حرکت کند، شرکت همه منفعت بهرهوری را نگه نمیدارد. kernel بهتر میتواند رایانش لازم برای یک کار را کم کند، اما هزینه برق، سختافزار، مواد یا تأمین مالی در جای دیگر زنجیره را حذف نمیکند.
صنایع نزدیکتر به فناوری از میانگین قویتر بودند. طبق تفسیر رسمی، تولید و سفارش جدید در ماشینآلات برقی و نیز رایانه، ارتباطات و تجهیزات الکترونیکی هر دو بالای ۵۳ قرار داشتند. PMI تجهیزات صنعتی ۵۱٫۴ و تولید پیشرفته ۵۲٫۹ بود؛ هر دو در محدوده رشد. در مقابل، کالای مصرفی ۴۹٫۰ و صنایع پرمصرف انرژی ۴۷٫۹ ثبت شدند. این فاصله از یک نشانه هدفمند تقاضای فناوری پشتیبانی میکند، نه این ادعا که مخارج AI کل اقتصاد را بالا میکشد. PMI فقط برتری پاسخهای «بهتر» بر «بدتر» را میسنجد؛ رشد درآمد، خرید شتابدهنده یا استفاده از مدل را اندازه نمیگیرد.
خدمات نیز نقشهای ناهموار دارد. فعالیت کسبوکار غیرتولیدی در ۴۹٫۰ بدون تغییر ماند؛ ساختوساز ۴۶٫۹ و خدمات ۴۹٫۳ بود. به گزارش اداره آمار، پست، مخابرات و پخش، و خدمات اینترنت، نرمافزار و فناوری اطلاعات همگی بالای ۵۵ قرار داشتند؛ عمدهفروشی، خردهفروشی و خدمات بازار سرمایه زیر ۵۰ بودند. سفارش جدید غیرتولیدی به ۴۴٫۱ افت کرد و اشتغال در ۴۵٫۴ ماند. شاخص ترکیبی با ۰٫۲ واحد رشد به ۴۹٫۵ رسید؛ یعنی قدرت چند گروه دیجیتال هنوز کل فعالیت را از مرز رشد عبور نداده است.
دو گزارش تازه فقط برای قاببندی به سند اصلی اضافه میشوند، نه جایگزینی آن. شینهوا برجسته کرد که ۱۶ صنعت از ۲۱ صنعت تولیدی نسبت به ژوئیه بهتر شدهاند و شاخص خرید به ۵۰٫۵ رسیده است. آسوشیتدپرس نیز نوشت عدد اصلی از انتظار اقتصاددانان بهتر بوده، هرچند کل تولید را همچنان در انقباض توصیف کرد. هیچکدام دامنه اثبات پیمایش را تغییر نمیدهند. نمونه تعدیلشده فصلی، ۳٬۲۰۰ بنگاه تولیدی در ۳۱ صنعت و ۴٬۳۰۰ بنگاه غیرتولیدی در ۴۳ صنعت را پوشش میدهد و گستردگی فعالیت را میسنجد، نه ارزش دلاری تقاضا را.
آزمون عملی و مالی از اینجا جداست. تیم مهندسی باید دو اصلاح را مستقل بازتولید کند، prefill و generation را برای بازههای طول متن جدا بسنجد و برق، حافظه، درخواست همزمان و تأخیر p95 را هم اضافه کند. تیم ظرفیت و مالی فقط بهبود تأییدشده در تولید را وارد فرض ساعت GPU یا هزینه نقدی کند و سپس ببیند استفاده بیشتر، صرفهجویی را پس میگیرد یا نه. در داده چین، تأیید بعدی زمانی است که تولید، خدمات و شاخص ترکیبی با هم از ۵۰ عبور کنند و سفارش و اشتغال بدون تشدید فشار قیمت نهاده بهتر شوند.
نتیجه قابلدفاع از عدد تیتر کوچکتر است. llama.cpp نشان داده متن بلند میتواند کار بیهوده پنهان داشته باشد: ۵۱٫۵ درصد رشد تولید در یک آزمون ۱۳۲ هزار توکنی و ۹٫۹ درصد رشد جداگانه پیشپردازش. پیمایش چین نیز رشد تولید پیشرفته و خدمات دیجیتال را در اقتصادی نشان میدهد که هنوز به توسعه فراگیر برنگشته و قیمت نهاده در آن سریعتر از قیمت خروجی حرکت میکند. کار مفید بیشتر در هر ساعت GPU هدف معتبر مهندسی و حاشیه سود است؛ اثبات دوام آن در بار واقعی و رسیدن به تقاضای پایدارِ پرداختکننده، آزمون دشوارتر خواهد بود.
منابع و اسناد
- 01Release b10707llama.cpp · ۹ شهریور ۱۴۰۵
- 02kv-cells: stop the sequence scan once all sequences are seenllama.cpp · ۸ شهریور ۱۴۰۵
- 03Release b10704llama.cpp · ۹ شهریور ۱۴۰۵
- 04CUDA: let any expert count use the fast mm_ids_helper pathllama.cpp · ۷ شهریور ۱۴۰۵
- 052026年8月中国采购经理指数运行情况National Bureau of Statistics of China and CFLP · ۹ شهریور ۱۴۰۵
- 06China's manufacturing PMI at 49.8 in AugustXinhua News Agency · ۹ شهریور ۱۴۰۵
- 07China's factory activity contracts in August despite an uptick in export demandAssociated Press · ۹ شهریور ۱۴۰۵
برچسبها
اخبار مرتبط

لاما سیپلاسپلاس با ادغام محاسبات، بعضی آزمونهای مک را سریعتر کرد
توسعهدهندگان لاما سیپلاسپلاس در ۱۹ سپتامبر مجموعهای از تغییرات اجرای مدل روی پردازندههای گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارششده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغامهای مشخص است، نه سریعتر شدن همه مدلها یا اثبات کاهش هزینه. اصلاح جداگانهای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یکساله مصرفکنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایتهای ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دستکم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایهگذاری کنند. این برنامه، هزینه انجامشده یا تضمین ایمنی نیست. همزمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا میشود. تحلیل ژرف توضیح میدهد چرا دسترسی ارزیاب، اختیار تصمیمگیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریعتر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
گوگل، انویدیا و امرالد ایآی ائتلافی ساختهاند که میخواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویلشده یا قاعده الزامآور نیست. ژرف بررسی میکند چنین وعدهای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کمکردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمیکند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یکچهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیمگر، عملکرد اندازهگیریشده و مسئولیت روشن هزینهها، معیارهای بعدیاند؛ نه صرف حمایت شرکتها.