۲ شهریور ۱۴۰۵

استنتاج AI میان‌بر می‌زند؛ انرژی کف هزینه را تعیین می‌کند

استنتاج AI میان‌بر می‌زند؛ انرژی کف هزینه را تعیین می‌کند

انتشار b10603 از llama.cpp پشتیبانی پیش‌بینی چندتوکنی را برای GLM-4.5-Air افزود و مسیر تازه‌ای برای speculative decoding در اجرای محلی ساخت. در بنچمارک مشارکت‌کننده، با چهار GPU مدل RTX 3090 و اجازه یک توکن پیش‌نویس، میانگین توان عملیاتی از ۷۴٫۵۵ به ۸۸٫۷۳ توکن در ثانیه رسید. همان جدول حد این نتیجه را هم نشان می‌دهد: سود با دو توکن کمتر شد و با سه توکن به افت سرعت تبدیل شد. در سوی فیزیکی معادله، گزارش تورم ژوئیه سنگاپور نشان داد تورم برق و گاز از منفی ۲٫۹ درصد در ژوئن به مثبت ۸٫۷ درصد در مقیاس سالانه جهش کرده و به افزایش تورم هسته به ۲٫۰ درصد و تورم کل به ۲٫۲ درصد کمک کرده است. این دو رویداد رابطه علّی ندارند؛ اما کنار هم روشن می‌کنند که نرم‌افزار می‌تواند هر گام استنتاج را پربازده‌تر کند، درحالی‌که نرخ پذیرش، سخت‌افزار، سرمایش، تعرفه برق و سرمایه تعیین می‌کنند توکن سریع‌تر واقعاً به کار ارزان‌تر و قابل اتکاتر تبدیل شود یا نه.


تحلیل ژرف

تازه‌ترین سیگنال معنادار AI یک انتشار کوچک سیستمی با درسی بزرگ برای بهره‌برداری است. llama.cpp در ۲۳ اوت ساعت ۱۸:۴۵:۵۹ UTC نسخه b10603 را منتشر کرد و از طریق درخواست ادغام 26534، پشتیبانی از پیش‌بینی چندتوکنی یا MTP را برای GLM-4.5-Air افزود. پیاده‌سازی برای سرِ پیش‌بینی مدل یک گراف پیش‌نویس می‌سازد، به مبدل اجازه می‌دهد tensorهای MTP را نگه دارد یا جدا کند و runtime می‌تواند GGUF ترکیبی، فقط تنه مدل یا فقط MTP را بارگذاری کند. در عمل، سامانه یک توکن را جلوتر پیشنهاد می‌دهد تا مدل اصلی آن را اعتبارسنجی کند و از هر عبور پرهزینه مدل هدف، خروجی پذیرفته‌شده بیشتری بگیرد. این یک میان‌بر استنتاج است؛ نه مدل تازه و نه تضمین قبض کمتر.

شفاف‌ترین بنچمارک درخواست ادغام از مدل هدف و پیش‌نویس quantized روی چهار GPU مدل RTX 3090 استفاده می‌کند. با وزن‌های Q4 برای هر دو، خط پایه به‌طور میانگین ۷۴٫۵۵ توکن در ثانیه بود؛ اجازه یک توکن پیش‌نویس میانگین را به ۸۸٫۷۳ رساند، یعنی بهبود گزارش‌شده ۱٫۱۹ برابر. با دو توکن، نسبت به ۱٫۱۲ برابر کاهش یافت و با سه توکن به ۰٫۹۷ برابر رسید؛ یعنی از خط پایه کندتر شد. مقایسه Q8 نیز همین شکل را داشت: ۱٫۱۰ برابر با یک، ۱٫۰۶ برابر با دو و ۰٫۹۵ برابر با سه توکن. ترکیب هدف Q4 و پیش‌نویس Q8 با یک توکن ۱٫۱۶ برابر شد، اما با سه توکن فقط ۰٫۹۲ برابر. کد فعلی نیز وجود فقط یک بلوک MTP را الزام می‌کند. این جزئیات از بهترین عدد تیتر مهم‌ترند: حدس اضافه فقط وقتی می‌ارزد که سهم کافی از کار پیشنهادی پذیرفته شود.

این شواهد مفید اما محدودند. اعداد را توسعه‌دهنده مشارکت‌کننده ارائه کرده، نه آزمایشگاه مستقل، و سنجش تحت تنظیم‌های مشخص quantization، batch، offload و چند GPU انجام شده است. گزارش، مصرف انرژی، توزیع latency، تغییر کیفیت، فشار حافظه، سربار اتصال یا هزینه هر توکن پذیرفته‌شده را نشان نمی‌دهد. artifact مستقل MTP-only GGUF که از درخواست ادغام پیوند شده بود، تا ۲۲ اوت ساعت ۱۰:۵۵:۳۸ UTC در Hugging Face در دسترس قرار گرفت و تکرار آزمون را برای دیگران ممکن می‌کند؛ اما دسترسی معادل اعتبارسنجی نیست. بهره‌بردار تولید باید ۱٫۱۹ برابر را نتیجه یک پیکربندی برای بازتولید بداند، نه ویژگی عمومی GLM-4.5-Air.

بااین‌حال پیام مهندسی مهم است. speculative decoding هدف بهینه‌سازی را از سرعت خام تولید به «کار پذیرفته‌شده در برابر هر واحد ظرفیت کمیاب» تغییر می‌دهد. پیش‌نویسی که ارزان اجرا شود و خوب پیش‌بینی کند، تعداد عبورهای سریال مدل هدف را کم می‌کند؛ پیش‌نویس عمیق‌تر یا نامتناسب می‌تواند ترافیک حافظه و محاسبه‌ای بسازد که اعتبارسنج دور می‌ریزد. داشبورد درست باید نرخ پذیرش، latency در صدک‌های ۵۰ و ۹۵، توکن بر ژول، ساعت GPU برای هر کار کامل، کنترل کیفیت خروجی و نرخ شکست یا تلاش دوباره را کنار هم بگذارد. اگر عامل منتظر شبکه باشد یا ابزار صدا بزند، سرعت تولید توکن شاید اصلاً گلوگاه نباشد. اهرم نرم‌افزار فقط زمانی واقعی است که کل گردش‌کار ارزان‌تر یا قابل اتکاتر شود.

داده قیمت مصرف‌کننده ژوئیه سنگاپور که ۲۴ اوت ساعت ۱۳:۰۰ محلی منتشر شد، نشان می‌دهد چرا مرز کامل هزینه مهم است. تورم هسته بانک مرکزی سنگاپور از ۱٫۶ درصد در ژوئن به ۲٫۰ درصد سالانه رسید و تورم کل CPI نیز از ۱٫۹ به ۲٫۲ درصد افزایش یافت. در مقیاس ماهانه، قیمت‌های هسته ۰٫۳ درصد بالا رفتند، هرچند شاخص کل ۰٫۲ درصد پایین آمد. شتاب اصلی از برق و گاز، خدمات و غذا آمد و تورم مسکن نیز افزایش یافت. این گزارش کلان اقتصادی است، نه سنجه قیمت برق مرکز داده، و نشان نمی‌دهد تقاضای AI علت تغییر بوده است.

جزئیات برق نمونه‌ای روشن از انتقال هزینه فیزیکی به قیمت است. تورم برق و گاز از منفی ۲٫۹ درصد در ژوئن به مثبت ۸٫۷ درصد در ژوئیه رسید، زیرا تعرفه تنظیم‌شده برق به‌شدت بالا رفت. گزارش رسمی توضیح می‌دهد تعرفه از میانگین قیمت گاز طبیعی فصل قبل استفاده می‌کند—برای تعرفه ژوئیه تا سپتامبر، بازه آوریل تا نیمه ژوئن—بنابراین هزینه سوخت با وقفه منتقل می‌شود. تورم خدمات از ۱٫۵ به ۱٫۷ درصد، غذا از ۲٫۱ به ۲٫۲ و مسکن از ۰٫۶ به ۰٫۸ درصد رسید؛ تورم کالاهای خرده‌فروشی از ۱٫۷ به ۱٫۴ و حمل‌ونقل خصوصی از ۸٫۴ به ۸٫۰ درصد کاهش یافت. پس افت ماهانه شاخص کل هم‌زمان با تورم هسته سالانه سریع‌تر و چرخش تند هزینه خدمات عمومی رخ داد.

برای بهره‌بردار AI، مقایسه عملیاتی است، نه علّی. بهینه‌سازی استنتاج می‌تواند زمان GPU برای خروجی پذیرفته‌شده را کم کند، اما بازتنظیم تعرفه، بار سرمایش، قرارداد ظرفیت رزروشده یا هزینه تأمین مالی می‌تواند صرفه‌جویی را جذب کند. آزمون اقتصاد واحد این نیست که بنچمارک از همان کارت توکن بیشتری بگیرد؛ باید دید پس از برق، سرمایش، شبکه، ذخیره‌سازی، مشاهده‌پذیری و کار speculative ردشده، استقرار به ازای هر ریال یا دلار چند وظیفه صحیح و مفید تحویل می‌دهد. همین منطق برای خریدار ابر برقرار است: ثانیه محاسبه کمتر مفید است، اما فقط اگر قیمت‌گذاری و حداقل تعهد ارائه‌دهنده، بهره‌وری را به مشتری منتقل کند و آن را به حاشیه سود تأمین‌کننده تبدیل نکند.

چشم‌انداز سنگاپور پیوند دوطرفه کلان را هم صریح می‌کند. MAS و وزارت تجارت و صنعت انتظار دارند میانگین تورم هسته و کل در سال ۲۰۲۶ هر دو بین ۱٫۵ تا ۲٫۵ درصد باشد. پیش‌بینی می‌کنند تورم هسته تا ۲۰۲۷ بالا بماند و اگر هزینه انرژی کاهش یابد، حدود میانه سال تعدیل شود؛ درعین‌حال نفت، کرایه حمل‌ونقل، آب‌وهوا و انتقال هزینه ورودی، ریسک‌ها را به سمت بالا متمایل می‌کنند. در سناریوی نزولی، سخت‌ترشدن شرایط مالی جهانی یا عقب‌نشینی سرمایه‌گذاری مرتبط با AI آمده است؛ سرمایه‌گذاری قوی‌تر فناوری اطلاعات نیز می‌تواند سرریز تقاضا در سوی صعودی بسازد. AI هم متغیر مخارج سرمایه‌ای این چشم‌انداز است و هم باری که اقتصادش در معرض مسیر انرژی باقی می‌ماند.

تفسیر درست از دو خطای متضاد دوری می‌کند. نادرست است نتیجه llama.cpp را فقط به دلیل نبود بنچمارک حسابرسی‌شده تولید کنار بگذاریم؛ runtimeهای باز بارها تغییر محدود در kernel یا graph را پس از بازتولید مستقل به ظرفیت معنادار تبدیل کرده‌اند. به همان اندازه نادرست است بهترین افزایش ۱۹ درصدی توان عملیاتی را مستقیماً کاهش ۱۹ درصدی هزینه سالانه بدانیم. برگشت نتیجه در سه توکن پیش‌نویس، هشدار خود جدول است. نرخ پذیرش، ترکیب مدل، جای‌گذاری حافظه و نوع workload نتیجه را شکل می‌دهند؛ برق و سرمایه تعیین می‌کنند چه سهمی از دستاورد فنی به صورت سود و زیان برسد.

موارد بعدی برای رصد مشخص‌اند. درباره GLM-4.5-Air، آزمون مستقل باید نرخ پذیرش، توان مصرفی، دنباله latency، برابری کیفیت و نتیجه روی سخت‌افزارهای دیگر را منتشر کند و نشان دهد بلوک‌های بیشتر MTP یا quantization متفاوت منحنی را بهتر می‌کنند یا نه. بهره‌بردار باید اجرای هدفِ تنها و اجرای speculative را در سطح وظیفه کامل مقایسه کند، نه اوج سرعت را گزینشی برگزیند. در سوی کلان، بازتنظیم تعرفه اکتبر سنگاپور، انتقال جهش انرژی ژوئیه به خدمات و غذا، و اعتبار فرض تعدیل در میانه ۲۰۲۷ اهمیت دارد. نتیجه قابل دفاع امروز محدود اما کاربردی است: نرم‌افزار استنتاج مسیر کوتاه‌تری پیدا کرده، ولی سامانه انرژی هنوز کف هزینه زیر آن را در اختیار دارد.


منابع و اسناد

  1. 01b10603: model: support MTP in GLM-4.5-Air (#26534)llama.cpp · ۱ شهریور ۱۴۰۵
  2. 02model: support MTP in GLM-4.5-Airllama.cpp · ۱ شهریور ۱۴۰۵
  3. 03jacek2024/GLM-4.5-Air-MTP-GGUFHugging Face Model Hub · ۳۱ مرداد ۱۴۰۵
  4. 04Consumer Price Developments in July 2026Ministry of Trade and Industry Singapore · ۲ شهریور ۱۴۰۵
  5. 05Consumer Price Developments in July 2026 — Detailed ReleaseMonetary Authority of Singapore · ۲ شهریور ۱۴۰۵

برچسب‌ها

استنتاج هوش مصنوعیپیش‌بینی چندتوکنیرمزگشایی speculativeمدل GLM-4.5-Airچارچوب llama.cppهزینه انرژیتورم سنگاپوراقتصاد واحد AI

اخبار مرتبط

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
۲۶ شهریور ۱۴۰۵منبع: NVIDIA

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند

گوگل، انویدیا و امرالد ای‌آی ائتلافی ساخته‌اند که می‌خواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویل‌شده یا قاعده الزام‌آور نیست. ژرف بررسی می‌کند چنین وعده‌ای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کم‌کردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمی‌کند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یک‌چهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیم‌گر، عملکرد اندازه‌گیری‌شده و مسئولیت روشن هزینه‌ها، معیارهای بعدی‌اند؛ نه صرف حمایت شرکت‌ها.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما