استنتاج AI میانبر میزند؛ انرژی کف هزینه را تعیین میکند

انتشار b10603 از llama.cpp پشتیبانی پیشبینی چندتوکنی را برای GLM-4.5-Air افزود و مسیر تازهای برای speculative decoding در اجرای محلی ساخت. در بنچمارک مشارکتکننده، با چهار GPU مدل RTX 3090 و اجازه یک توکن پیشنویس، میانگین توان عملیاتی از ۷۴٫۵۵ به ۸۸٫۷۳ توکن در ثانیه رسید. همان جدول حد این نتیجه را هم نشان میدهد: سود با دو توکن کمتر شد و با سه توکن به افت سرعت تبدیل شد. در سوی فیزیکی معادله، گزارش تورم ژوئیه سنگاپور نشان داد تورم برق و گاز از منفی ۲٫۹ درصد در ژوئن به مثبت ۸٫۷ درصد در مقیاس سالانه جهش کرده و به افزایش تورم هسته به ۲٫۰ درصد و تورم کل به ۲٫۲ درصد کمک کرده است. این دو رویداد رابطه علّی ندارند؛ اما کنار هم روشن میکنند که نرمافزار میتواند هر گام استنتاج را پربازدهتر کند، درحالیکه نرخ پذیرش، سختافزار، سرمایش، تعرفه برق و سرمایه تعیین میکنند توکن سریعتر واقعاً به کار ارزانتر و قابل اتکاتر تبدیل شود یا نه.
تحلیل ژرف
تازهترین سیگنال معنادار AI یک انتشار کوچک سیستمی با درسی بزرگ برای بهرهبرداری است. llama.cpp در ۲۳ اوت ساعت ۱۸:۴۵:۵۹ UTC نسخه b10603 را منتشر کرد و از طریق درخواست ادغام 26534، پشتیبانی از پیشبینی چندتوکنی یا MTP را برای GLM-4.5-Air افزود. پیادهسازی برای سرِ پیشبینی مدل یک گراف پیشنویس میسازد، به مبدل اجازه میدهد tensorهای MTP را نگه دارد یا جدا کند و runtime میتواند GGUF ترکیبی، فقط تنه مدل یا فقط MTP را بارگذاری کند. در عمل، سامانه یک توکن را جلوتر پیشنهاد میدهد تا مدل اصلی آن را اعتبارسنجی کند و از هر عبور پرهزینه مدل هدف، خروجی پذیرفتهشده بیشتری بگیرد. این یک میانبر استنتاج است؛ نه مدل تازه و نه تضمین قبض کمتر.
شفافترین بنچمارک درخواست ادغام از مدل هدف و پیشنویس quantized روی چهار GPU مدل RTX 3090 استفاده میکند. با وزنهای Q4 برای هر دو، خط پایه بهطور میانگین ۷۴٫۵۵ توکن در ثانیه بود؛ اجازه یک توکن پیشنویس میانگین را به ۸۸٫۷۳ رساند، یعنی بهبود گزارششده ۱٫۱۹ برابر. با دو توکن، نسبت به ۱٫۱۲ برابر کاهش یافت و با سه توکن به ۰٫۹۷ برابر رسید؛ یعنی از خط پایه کندتر شد. مقایسه Q8 نیز همین شکل را داشت: ۱٫۱۰ برابر با یک، ۱٫۰۶ برابر با دو و ۰٫۹۵ برابر با سه توکن. ترکیب هدف Q4 و پیشنویس Q8 با یک توکن ۱٫۱۶ برابر شد، اما با سه توکن فقط ۰٫۹۲ برابر. کد فعلی نیز وجود فقط یک بلوک MTP را الزام میکند. این جزئیات از بهترین عدد تیتر مهمترند: حدس اضافه فقط وقتی میارزد که سهم کافی از کار پیشنهادی پذیرفته شود.
این شواهد مفید اما محدودند. اعداد را توسعهدهنده مشارکتکننده ارائه کرده، نه آزمایشگاه مستقل، و سنجش تحت تنظیمهای مشخص quantization، batch، offload و چند GPU انجام شده است. گزارش، مصرف انرژی، توزیع latency، تغییر کیفیت، فشار حافظه، سربار اتصال یا هزینه هر توکن پذیرفتهشده را نشان نمیدهد. artifact مستقل MTP-only GGUF که از درخواست ادغام پیوند شده بود، تا ۲۲ اوت ساعت ۱۰:۵۵:۳۸ UTC در Hugging Face در دسترس قرار گرفت و تکرار آزمون را برای دیگران ممکن میکند؛ اما دسترسی معادل اعتبارسنجی نیست. بهرهبردار تولید باید ۱٫۱۹ برابر را نتیجه یک پیکربندی برای بازتولید بداند، نه ویژگی عمومی GLM-4.5-Air.
بااینحال پیام مهندسی مهم است. speculative decoding هدف بهینهسازی را از سرعت خام تولید به «کار پذیرفتهشده در برابر هر واحد ظرفیت کمیاب» تغییر میدهد. پیشنویسی که ارزان اجرا شود و خوب پیشبینی کند، تعداد عبورهای سریال مدل هدف را کم میکند؛ پیشنویس عمیقتر یا نامتناسب میتواند ترافیک حافظه و محاسبهای بسازد که اعتبارسنج دور میریزد. داشبورد درست باید نرخ پذیرش، latency در صدکهای ۵۰ و ۹۵، توکن بر ژول، ساعت GPU برای هر کار کامل، کنترل کیفیت خروجی و نرخ شکست یا تلاش دوباره را کنار هم بگذارد. اگر عامل منتظر شبکه باشد یا ابزار صدا بزند، سرعت تولید توکن شاید اصلاً گلوگاه نباشد. اهرم نرمافزار فقط زمانی واقعی است که کل گردشکار ارزانتر یا قابل اتکاتر شود.
داده قیمت مصرفکننده ژوئیه سنگاپور که ۲۴ اوت ساعت ۱۳:۰۰ محلی منتشر شد، نشان میدهد چرا مرز کامل هزینه مهم است. تورم هسته بانک مرکزی سنگاپور از ۱٫۶ درصد در ژوئن به ۲٫۰ درصد سالانه رسید و تورم کل CPI نیز از ۱٫۹ به ۲٫۲ درصد افزایش یافت. در مقیاس ماهانه، قیمتهای هسته ۰٫۳ درصد بالا رفتند، هرچند شاخص کل ۰٫۲ درصد پایین آمد. شتاب اصلی از برق و گاز، خدمات و غذا آمد و تورم مسکن نیز افزایش یافت. این گزارش کلان اقتصادی است، نه سنجه قیمت برق مرکز داده، و نشان نمیدهد تقاضای AI علت تغییر بوده است.
جزئیات برق نمونهای روشن از انتقال هزینه فیزیکی به قیمت است. تورم برق و گاز از منفی ۲٫۹ درصد در ژوئن به مثبت ۸٫۷ درصد در ژوئیه رسید، زیرا تعرفه تنظیمشده برق بهشدت بالا رفت. گزارش رسمی توضیح میدهد تعرفه از میانگین قیمت گاز طبیعی فصل قبل استفاده میکند—برای تعرفه ژوئیه تا سپتامبر، بازه آوریل تا نیمه ژوئن—بنابراین هزینه سوخت با وقفه منتقل میشود. تورم خدمات از ۱٫۵ به ۱٫۷ درصد، غذا از ۲٫۱ به ۲٫۲ و مسکن از ۰٫۶ به ۰٫۸ درصد رسید؛ تورم کالاهای خردهفروشی از ۱٫۷ به ۱٫۴ و حملونقل خصوصی از ۸٫۴ به ۸٫۰ درصد کاهش یافت. پس افت ماهانه شاخص کل همزمان با تورم هسته سالانه سریعتر و چرخش تند هزینه خدمات عمومی رخ داد.
برای بهرهبردار AI، مقایسه عملیاتی است، نه علّی. بهینهسازی استنتاج میتواند زمان GPU برای خروجی پذیرفتهشده را کم کند، اما بازتنظیم تعرفه، بار سرمایش، قرارداد ظرفیت رزروشده یا هزینه تأمین مالی میتواند صرفهجویی را جذب کند. آزمون اقتصاد واحد این نیست که بنچمارک از همان کارت توکن بیشتری بگیرد؛ باید دید پس از برق، سرمایش، شبکه، ذخیرهسازی، مشاهدهپذیری و کار speculative ردشده، استقرار به ازای هر ریال یا دلار چند وظیفه صحیح و مفید تحویل میدهد. همین منطق برای خریدار ابر برقرار است: ثانیه محاسبه کمتر مفید است، اما فقط اگر قیمتگذاری و حداقل تعهد ارائهدهنده، بهرهوری را به مشتری منتقل کند و آن را به حاشیه سود تأمینکننده تبدیل نکند.
چشمانداز سنگاپور پیوند دوطرفه کلان را هم صریح میکند. MAS و وزارت تجارت و صنعت انتظار دارند میانگین تورم هسته و کل در سال ۲۰۲۶ هر دو بین ۱٫۵ تا ۲٫۵ درصد باشد. پیشبینی میکنند تورم هسته تا ۲۰۲۷ بالا بماند و اگر هزینه انرژی کاهش یابد، حدود میانه سال تعدیل شود؛ درعینحال نفت، کرایه حملونقل، آبوهوا و انتقال هزینه ورودی، ریسکها را به سمت بالا متمایل میکنند. در سناریوی نزولی، سختترشدن شرایط مالی جهانی یا عقبنشینی سرمایهگذاری مرتبط با AI آمده است؛ سرمایهگذاری قویتر فناوری اطلاعات نیز میتواند سرریز تقاضا در سوی صعودی بسازد. AI هم متغیر مخارج سرمایهای این چشمانداز است و هم باری که اقتصادش در معرض مسیر انرژی باقی میماند.
تفسیر درست از دو خطای متضاد دوری میکند. نادرست است نتیجه llama.cpp را فقط به دلیل نبود بنچمارک حسابرسیشده تولید کنار بگذاریم؛ runtimeهای باز بارها تغییر محدود در kernel یا graph را پس از بازتولید مستقل به ظرفیت معنادار تبدیل کردهاند. به همان اندازه نادرست است بهترین افزایش ۱۹ درصدی توان عملیاتی را مستقیماً کاهش ۱۹ درصدی هزینه سالانه بدانیم. برگشت نتیجه در سه توکن پیشنویس، هشدار خود جدول است. نرخ پذیرش، ترکیب مدل، جایگذاری حافظه و نوع workload نتیجه را شکل میدهند؛ برق و سرمایه تعیین میکنند چه سهمی از دستاورد فنی به صورت سود و زیان برسد.
موارد بعدی برای رصد مشخصاند. درباره GLM-4.5-Air، آزمون مستقل باید نرخ پذیرش، توان مصرفی، دنباله latency، برابری کیفیت و نتیجه روی سختافزارهای دیگر را منتشر کند و نشان دهد بلوکهای بیشتر MTP یا quantization متفاوت منحنی را بهتر میکنند یا نه. بهرهبردار باید اجرای هدفِ تنها و اجرای speculative را در سطح وظیفه کامل مقایسه کند، نه اوج سرعت را گزینشی برگزیند. در سوی کلان، بازتنظیم تعرفه اکتبر سنگاپور، انتقال جهش انرژی ژوئیه به خدمات و غذا، و اعتبار فرض تعدیل در میانه ۲۰۲۷ اهمیت دارد. نتیجه قابل دفاع امروز محدود اما کاربردی است: نرمافزار استنتاج مسیر کوتاهتری پیدا کرده، ولی سامانه انرژی هنوز کف هزینه زیر آن را در اختیار دارد.
منابع و اسناد
- 01b10603: model: support MTP in GLM-4.5-Air (#26534)llama.cpp · ۱ شهریور ۱۴۰۵
- 02model: support MTP in GLM-4.5-Airllama.cpp · ۱ شهریور ۱۴۰۵
- 03jacek2024/GLM-4.5-Air-MTP-GGUFHugging Face Model Hub · ۳۱ مرداد ۱۴۰۵
- 04Consumer Price Developments in July 2026Ministry of Trade and Industry Singapore · ۲ شهریور ۱۴۰۵
- 05Consumer Price Developments in July 2026 — Detailed ReleaseMonetary Authority of Singapore · ۲ شهریور ۱۴۰۵
برچسبها
اخبار مرتبط

لاما سیپلاسپلاس با ادغام محاسبات، بعضی آزمونهای مک را سریعتر کرد
توسعهدهندگان لاما سیپلاسپلاس در ۱۹ سپتامبر مجموعهای از تغییرات اجرای مدل روی پردازندههای گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارششده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغامهای مشخص است، نه سریعتر شدن همه مدلها یا اثبات کاهش هزینه. اصلاح جداگانهای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یکساله مصرفکنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایتهای ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دستکم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایهگذاری کنند. این برنامه، هزینه انجامشده یا تضمین ایمنی نیست. همزمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا میشود. تحلیل ژرف توضیح میدهد چرا دسترسی ارزیاب، اختیار تصمیمگیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریعتر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
گوگل، انویدیا و امرالد ایآی ائتلافی ساختهاند که میخواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویلشده یا قاعده الزامآور نیست. ژرف بررسی میکند چنین وعدهای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کمکردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمیکند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یکچهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیمگر، عملکرد اندازهگیریشده و مسئولیت روشن هزینهها، معیارهای بعدیاند؛ نه صرف حمایت شرکتها.