۹ شهریور ۱۴۰۵

llama.cpp با حذف جست‌وجوی زائد، یک آزمون متن بلند را ۵۱ درصد سریع‌تر می‌کند

llama.cpp با حذف جست‌وجوی زائد، یک آزمون متن بلند را ۵۱ درصد سریع‌تر می‌کند

نسخه b10707 پروژه llama.cpp پس از پیداکردن همه توالی‌های واقعی یک خانه KV-cache، جست‌وجوی n-gram را متوقف می‌کند؛ پیش از این، مسیر کد می‌توانست هر ۲۵۶ جایگاه ممکن را بررسی کند. در آزمون گزارش‌شده با RTX PRO 6000 و نسخه quantized مدل Qwen3.8-Flash-Next، سرعت تولید در متن ۱۳۲ هزار توکنی از ۳۳٫۶ به ۵۰٫۹ توکن در ثانیه رسید؛ یعنی ۵۱٫۵ درصد بهبود در همان آزمون، بدون تغییر سرعت پردازش prompt. اصلاح جداگانه CUDA نیز پیش‌پردازش یک آزمون ۵۵ هزار توکنی را ۹٫۹ درصد بالا برد. این اعداد، سنجش پروژه‌اند و کاهش قطعی هزینه یک ناوگان نیستند. شاخص مدیران خرید اوت چین، آزمون مالی و تقاضای ماجراست: تولید صنعتی به ۴۹٫۸ و تولید پیشرفته به ۵۲٫۹ رسید، اما شاخص ترکیبی در ۴۹٫۵ زیر مرز رشد ماند. قیمت نهاده ۵۶٫۶ بود و قیمت خروجی کارخانه فقط به ۵۰٫۴ رسید؛ پس بهره‌وری نرم‌افزار برای حاشیه سود مهم است، ولی به‌تنهایی تقاضای قوی‌تر را ثابت نمی‌کند.


تحلیل ژرف

نسخه b10707 پروژه llama.cpp در نخستین ساعات ۳۱ اوت یک کار تکراری را از مسیر تولید متن بلند کنار گذاشت. جست‌وجوی n-gram که در speculative decoding استفاده می‌شود، برای هر خانه پُر KV-cache تا ۲۵۶ جایگاه ممکن توالی را می‌گشت؛ در حالی که معمولاً همان خانه فقط به یک توالی تعلق دارد. اصلاح شماره 28011 توالی‌های واقعاً موجود را می‌شمارد و به‌محض دیدن همه آن‌ها، جست‌وجو را پایان می‌دهد. ترتیب پیمایش و رفتار callback عوض نشده است؛ مدل پاسخ دیگری تولید نمی‌کند، فقط دیگر مجبور نیست فهرست خالی را تا انتها بخواند.

اثر گزارش‌شده بزرگ است، اما دامنه آن باید همان‌قدر دقیق بماند. آزمون روی RTX PRO 6000، با flash attention و نسخه UD-Q4_K_XL مدل Qwen3.8-Flash-Next انجام شده است. در متن ۵۵ هزار توکنی، سرعت تولید از ۵۶٫۳ به ۷۴٫۳ توکن در ثانیه رسید؛ ۳۲ درصد بیشتر. در ۱۳۲ هزار توکن، عدد از ۳۳٫۶ به ۵۰٫۹ رسید؛ یعنی ۵۱٫۵ درصد. سرعت پردازش prompt تغییر نکرد. هرچه خانه‌های بیشتری از KV-cache پُر شود، حذف جست‌وجوی زائد اثر بیشتری دارد و به گفته نویسنده اصلاح، در prompt کوتاه تقریباً دیده نمی‌شود. پس با یک سنجش گرم پروژه روی یک GPU، یک مدل و یک نوع quantization روبه‌رو هستیم، نه مطالعه مستقل ناوگان و نه وعده سرعت ۵۱ درصدی برای همه بارها.

نسخه b10704 در همین چرخه ۴۸ ساعته، گلوگاه دیگری را در مرحله پیش‌پردازش هدف گرفت. مسیر سریع CUDA برای گروه‌بندی expertها قبلاً تعدادهایی را می‌پذیرفت که ۳۲ lane یک warp بر آن‌ها بخش‌پذیر باشد و برای عدد شش هم استثنا داشت. Qwen3.8-Flash-Next ده expert دارد و به همین دلیل به kernel کندتر می‌افتاد. کد تازه اندازه گروه را تا توان بعدی عدد دو پُر می‌کند، ولی همچنان همان ده expert را اجرا می‌کند. در سنجش اصلاح‌شده نویسنده روی همان RTX PRO 6000 و متن ۵۵ هزار توکنی، سرعت پردازش prompt از ۲٬۱۳۹ به ۲٬۳۵۱ توکن در ثانیه رسید؛ ۹٫۹ درصد رشد. سرعت تولید تغییر نکرد و مسیر فقط روی warpهای ۳۲-lane CUDA آزموده شده است.

این دو درصد را نباید با هم جمع کرد. اصلاح نخست، اسکن توالی را هنگام تولید کم می‌کند؛ اصلاح دوم، expertها را هنگام خواندن prompt بهتر مسیردهی می‌کند. هیچ‌کدام هنوز مصرف برق، هم‌زمانی درخواست‌های واقعی، تأخیر دنباله توزیع یا هزینه کامل سرویس را اندازه نگرفته‌اند. پیام عملی محدودتر اما مهم است: نرم‌افزار می‌تواند روی همان شتاب‌دهنده نصب‌شده، کار مفید بیشتری در هر ساعت GPU تحویل دهد. برنامه‌ریز ظرفیت پیش از ثبت این عدد در بودجه باید آن را روی مدل، توزیع طول متن و سیاست batch خود تکرار کند.

شاخص مدیران خرید اوت چین که اداره ملی آمار در ۳۱ اوت منتشر کرد، سمت تقاضا و مالی را به بحث اضافه می‌کند. PMI تولیدی با ۰٫۶ واحد رشد به ۴۹٫۸ رسید و هنوز زیر مرز ۵۰ ماند. شاخص تولید ۵۰٫۴ و سفارش جدید ۵۰٫۶ بود؛ سفارش صادراتی نیز ۵۰٫۱ ثبت شد. بنگاه‌های بزرگ با ۵۰٫۶ به محدوده رشد برگشتند، اما متوسط‌ها در ۴۹٫۴ و کوچک‌ها در ۴۷٫۹ ماندند. بهبود آن‌قدر گسترده است که مهم باشد، ولی هنوز نمی‌توان کل بخش تولید را در حال رشد نامید.

شکاف قیمت‌ها برای حاشیه سود مهم‌تر است. شاخص قیمت نهاده با ۳٫۴ واحد رشد به ۵۶٫۶ جهش کرد؛ قیمت خروجی کارخانه ۲٫۶ واحد بالا رفت و به ۵۰٫۴ رسید. تفسیر رسمی بخشی از این حرکت را به افزایش قیمت نفت خام و فلزات غیرآهنی نسبت می‌دهد و در ذوب و فرآوری فلزات غیرآهنی، هر دو شاخص قیمت بالای ۶۰ بوده‌اند. وقتی هزینه نهاده از سطح بالاتری و سریع‌تر از قیمت فروش حرکت کند، شرکت همه منفعت بهره‌وری را نگه نمی‌دارد. kernel بهتر می‌تواند رایانش لازم برای یک کار را کم کند، اما هزینه برق، سخت‌افزار، مواد یا تأمین مالی در جای دیگر زنجیره را حذف نمی‌کند.

صنایع نزدیک‌تر به فناوری از میانگین قوی‌تر بودند. طبق تفسیر رسمی، تولید و سفارش جدید در ماشین‌آلات برقی و نیز رایانه، ارتباطات و تجهیزات الکترونیکی هر دو بالای ۵۳ قرار داشتند. PMI تجهیزات صنعتی ۵۱٫۴ و تولید پیشرفته ۵۲٫۹ بود؛ هر دو در محدوده رشد. در مقابل، کالای مصرفی ۴۹٫۰ و صنایع پرمصرف انرژی ۴۷٫۹ ثبت شدند. این فاصله از یک نشانه هدفمند تقاضای فناوری پشتیبانی می‌کند، نه این ادعا که مخارج AI کل اقتصاد را بالا می‌کشد. PMI فقط برتری پاسخ‌های «بهتر» بر «بدتر» را می‌سنجد؛ رشد درآمد، خرید شتاب‌دهنده یا استفاده از مدل را اندازه نمی‌گیرد.

خدمات نیز نقشه‌ای ناهموار دارد. فعالیت کسب‌وکار غیرتولیدی در ۴۹٫۰ بدون تغییر ماند؛ ساخت‌وساز ۴۶٫۹ و خدمات ۴۹٫۳ بود. به گزارش اداره آمار، پست، مخابرات و پخش، و خدمات اینترنت، نرم‌افزار و فناوری اطلاعات همگی بالای ۵۵ قرار داشتند؛ عمده‌فروشی، خرده‌فروشی و خدمات بازار سرمایه زیر ۵۰ بودند. سفارش جدید غیرتولیدی به ۴۴٫۱ افت کرد و اشتغال در ۴۵٫۴ ماند. شاخص ترکیبی با ۰٫۲ واحد رشد به ۴۹٫۵ رسید؛ یعنی قدرت چند گروه دیجیتال هنوز کل فعالیت را از مرز رشد عبور نداده است.

دو گزارش تازه فقط برای قاب‌بندی به سند اصلی اضافه می‌شوند، نه جایگزینی آن. شین‌هوا برجسته کرد که ۱۶ صنعت از ۲۱ صنعت تولیدی نسبت به ژوئیه بهتر شده‌اند و شاخص خرید به ۵۰٫۵ رسیده است. آسوشیتدپرس نیز نوشت عدد اصلی از انتظار اقتصاددانان بهتر بوده، هرچند کل تولید را همچنان در انقباض توصیف کرد. هیچ‌کدام دامنه اثبات پیمایش را تغییر نمی‌دهند. نمونه تعدیل‌شده فصلی، ۳٬۲۰۰ بنگاه تولیدی در ۳۱ صنعت و ۴٬۳۰۰ بنگاه غیرتولیدی در ۴۳ صنعت را پوشش می‌دهد و گستردگی فعالیت را می‌سنجد، نه ارزش دلاری تقاضا را.

آزمون عملی و مالی از اینجا جداست. تیم مهندسی باید دو اصلاح را مستقل بازتولید کند، prefill و generation را برای بازه‌های طول متن جدا بسنجد و برق، حافظه، درخواست هم‌زمان و تأخیر p95 را هم اضافه کند. تیم ظرفیت و مالی فقط بهبود تأییدشده در تولید را وارد فرض ساعت GPU یا هزینه نقدی کند و سپس ببیند استفاده بیشتر، صرفه‌جویی را پس می‌گیرد یا نه. در داده چین، تأیید بعدی زمانی است که تولید، خدمات و شاخص ترکیبی با هم از ۵۰ عبور کنند و سفارش و اشتغال بدون تشدید فشار قیمت نهاده بهتر شوند.

نتیجه قابل‌دفاع از عدد تیتر کوچک‌تر است. llama.cpp نشان داده متن بلند می‌تواند کار بیهوده پنهان داشته باشد: ۵۱٫۵ درصد رشد تولید در یک آزمون ۱۳۲ هزار توکنی و ۹٫۹ درصد رشد جداگانه پیش‌پردازش. پیمایش چین نیز رشد تولید پیشرفته و خدمات دیجیتال را در اقتصادی نشان می‌دهد که هنوز به توسعه فراگیر برنگشته و قیمت نهاده در آن سریع‌تر از قیمت خروجی حرکت می‌کند. کار مفید بیشتر در هر ساعت GPU هدف معتبر مهندسی و حاشیه سود است؛ اثبات دوام آن در بار واقعی و رسیدن به تقاضای پایدارِ پرداخت‌کننده، آزمون دشوارتر خواهد بود.


منابع و اسناد

  1. 01Release b10707llama.cpp · ۹ شهریور ۱۴۰۵
  2. 02kv-cells: stop the sequence scan once all sequences are seenllama.cpp · ۸ شهریور ۱۴۰۵
  3. 03Release b10704llama.cpp · ۹ شهریور ۱۴۰۵
  4. 04CUDA: let any expert count use the fast mm_ids_helper pathllama.cpp · ۷ شهریور ۱۴۰۵
  5. 052026年8月中国采购经理指数运行情况National Bureau of Statistics of China and CFLP · ۹ شهریور ۱۴۰۵
  6. 06China's manufacturing PMI at 49.8 in AugustXinhua News Agency · ۹ شهریور ۱۴۰۵
  7. 07China's factory activity contracts in August despite an uptick in export demandAssociated Press · ۹ شهریور ۱۴۰۵

برچسب‌ها

پروژه llama.cppاستنتاج متن بلندفناوری CUDAبهره‌وری پردازنده گرافیکیشاخص مدیران خرید چینتولید پیشرفتهقیمت نهادهزیرساخت هوش مصنوعی

اخبار مرتبط

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
۲۶ شهریور ۱۴۰۵منبع: NVIDIA

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند

گوگل، انویدیا و امرالد ای‌آی ائتلافی ساخته‌اند که می‌خواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویل‌شده یا قاعده الزام‌آور نیست. ژرف بررسی می‌کند چنین وعده‌ای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کم‌کردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمی‌کند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یک‌چهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیم‌گر، عملکرد اندازه‌گیری‌شده و مسئولیت روشن هزینه‌ها، معیارهای بعدی‌اند؛ نه صرف حمایت شرکت‌ها.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما