استنتاج هوش مصنوعی بهینهتر میشود؛ تقاضا سرمایه را بازقیمتگذاری میکند

پنجره انتشار امروز شکاف مهمی را میان بهرهوری محاسبات و قیمت سرمایه آشکار میکند. دو بهروزرسانی llama.cpp بهبودهایی محدود اما عینی در استنتاج ایجاد کردند: یکی چند عملیات CUDA را در یک کرنل ادغام کرد و در آزمونهای اجراشده توسط مشارکتکننده روی RTX 5090 حدود یک درصد بهبود نشان داد؛ دیگری dispatch جاافتاده یک قالب کوانتیزه را روی سختافزار SpaceMiT بازگرداند و خروجی مخدوش را اصلاح کرد. هیچکدام جهش عمومی هزینه را اثبات نمیکنند. در سطح کلان، تازهترین خلاصه دیدگاههای بانک ژاپن تقاضای جهانی AI را پشتیبان رشد و در عین حال نیرویی بالقوه برای افزایش فعالیت، قیمتها و مسیر نرخ میداند و تعدیل سهام ناشی از افت انتظارات سودآوری AI را ریسک نزولی میشمارد. حسابهای خارجی ژوئن ژاپن و نظرسنجی Economy Watchers ژوئیه نیز قید مهمی میگذارند: مازاد حساب جاری تعدیلشده فصلی ۵۴٫۴ درصد نسبت به ماه قبل افت کرد و هر دو شاخص وضعیت جاری و چشمانداز، با وجود بهبود، زیر مرز خنثی ۵۰ ماندند. نتیجه ZharfAI این است که استنتاج بهینهتر ارزش دارد، اما اقتصاد بار کاری همچنان باید از هزینه انرژی، سختافزار، تورم و تأمین مالی عبور کند.
تحلیل ژرفایآی
مهمترین پیوند در پنجره شواهد ۳۰ تا ۴۸ ساعته، عرضه پرزرقوبرق یک مدل نیست؛ تنش میان دو تغییر کوچک در موتور استنتاج و یک بانک مرکزی است که تقاضای AI را آشکارا نیروی کلان اقتصادی میداند. نسخههای b10330 و b10333 از llama.cpp نشان میدهند مهندسان با چه سرعتی میتوانند مرز یک کرنل را حذف یا dispatch یک شتابدهنده را اصلاح کنند. خلاصه دیدگاههای ۱۰ اوت بانک ژاپن نیز توضیح میدهد چرا این بهبودها اقتصاد پروژه را قطعی نمیکنند: سرمایهگذاری AI میتواند تولید و قیمت را تقویت کند، بر سرعت عادیسازی نرخ اثر بگذارد و اگر سود مورد انتظار محقق نشود ریسک نزولی بسازد. داده تازه حسابهای خارجی و احساس محلی ژاپن نیز نقش آزمون واقعیت را دارد، نه جشن پیروزی. این شماره تا حد ممکن در پنجره ۳۰ ساعته میماند و فقط برای نسخه CUDA هشتم اوت، منتشرشده ۳۶ ساعت پیش از این گزارش، به چرخه مهندسی جهانی اخیر امتداد مییابد.
نسخه b10330 عملیات RMS normalization، ضرب، rotary positional embedding و در موارد مرتبط view و row selection را در یک کرنل CUDA ادغام کرد. تغییر مرتبط ۳۴۴ سطر افزوده در چهار فایل، مقایسه ۷۲ عملیات backend با خروجی CPU و عبور مجموعه آزمون پروژه و بررسی حافظه را گزارش میکند. در RTX 5090 با CUDA 13.3، اجرای Qwen3-4B و Qwen3-30B-A3B با کوانتیزه Q4_K_M توسط مشارکتکننده، در چند مورد منتخب پردازش prompt و تولید توکن حدود یک درصد بهبود نشان داد. در یک نمونه تولید از ۳۷۳٫۰۲ به ۳۷۷٫۰۳ توکن در ثانیه رسید و در نمونه دیگر پردازش prompt با ۲۰۴۸ توکن از ۱۸۹۱۷٫۰۷ به ۱۹۱۲۸٫۳۰ افزایش یافت. کاهش تعداد launch و ترافیک حافظه میانی سازوکارهای معتبریاند، اما اینها نتایج خود پروژه روی یک GPU ردهبالا، دو مدل کوانتیزه و بیست تکرارند؛ نه بنچمارک عمومی latency، انرژی یا هزینه cloud.
نسخه b10333 کوچکتر و از نظر عملیاتی هشداردهندهتر است. یک تغییر دو سطری در backend شرکت SpaceMiT، dispatch جاافتاده کوانتیزه Q5_0 را روی شتابدهنده K3 بازگرداند. پیش از اصلاح، روشن کردن شتابدهی متن مخدوش تولید میکرد؛ مشارکتکننده پس از اصلاح، خروجی عادی را در سه مدل آزمودهشده گزارش کرد. همان سند میگوید استنتاج prompt تقریباً ۴۰ برابر نمونه بدون شتابدهی بود، اما این مقایسه از نویسنده patch میآید، نه آزمایشگاه مستقل، و نسخه ماتریس گسترده بار کاری، کیفیت، توان یا حرارت ارائه نمیکند. درس ماندگار، تقدم صحت بر سرعت است: مسیری که خروجی غیرقابلاستفاده میدهد، با هر throughput اسمی، ارزش اقتصادی صفر دارد. خلأ کوچک در پوشش dispatch میتواند سود سیلیکون تخصصی را تا آزمون دقیق ترکیب کوانتیزه و مدل از بین ببرد.
این دو نسخه دو شکل متفاوت از بهرهوری استنتاج را نشان میدهند. ادغام کرنل بهدنبال بهبود حاشیهای throughput و ترافیک حافظه روی مسیر بالغ و بسیار سریع GPU است؛ اصلاح dispatch یک شتابدهنده edge را اساساً قابلاستفاده میکند. هیچکدام اجازه نمیدهد بگوییم AI بهطور عمومی یک درصد یا ۴۰ برابر ارزانتر شده است. هزینه هر نتیجه مفید به utilization، شکل batch و context، صحت عددی، تکرارها، ظرفیت حافظه، مصرف برق، زمان اپراتور و سهم عملیات تغییریافته از کل latency وابسته است. بهبود یک کرنل میتواند در سرویس دائمی و مقیاس بزرگ انباشته شود، اما پشت شبکه، بارگذاری مدل، sampling یا ظرفیت بیکار نیز محو میشود. تیم مالی به مخرج در سطح بار کاری نیاز دارد: خروجی تأییدشده بهازای هر واتساعت و هر واحد پول با همه هزینهها، نه تصویر اوج توکن بر ثانیه.
خلاصه دیدگاههای ۱۰ اوت بانک ژاپن این مخرج را وارد سیاست پولی میکند. اعضای هیئت نوشتهاند تقاضای جهانی مرتبط با AI از رشد پشتیبانی میکند، ممکن است گستردهتر از انتظار در حال انتشار باشد و میتواند فعالیت اقتصادی و قیمتها را بالاتر ببرد. چند دیدگاه در صورت تحقق چشمانداز از ادامه عادیسازی حمایت کردند و یک دیدگاه گفت سرعت افزایش نرخ سیاستی ممکن است از انتظار بازار بیشتر شود. دیگران ترجیح دادند در نشست ژوئیه نرخ ثابت بماند تا اثر افزایش قبلی و داده جدید سنجیده شود. این سند متن رأیبهرأی یا جدول زمانی قطعی نیست؛ گزیدهای است که رئیس بانک از دیدگاههای جداگانه اعضای هیئت و نمایندگان دولت در نشست ۳۰ و ۳۱ ژوئیه تدوین کرده است. با این حال تأیید میکند تقاضای AI اکنون در بحث تورم، انتظارات و نرخ بهره بانک حضور دارد، نه فقط در پیشبینی بخش فناوری.
همان خلاصه، قویترین استدلال مخالف یک رونق بیقید سرمایهگذاری AI را ارائه میکند. یک دیدگاه هشدار میدهد اگر انتظار سودآوری AI کاهش یابد، تعدیل قیمت سهام میتواند فعالیت اقتصادی و قیمتها را تضعیف کند. این ریسک شرطی است، نه پیشبینی سقوط. مسیر معکوس نیز ممکن است: تقاضای قویتر از انتظار AI سرمایهگذاری و درآمد شرکت را بالا میبرد، در حالی که فشار پایدار قیمت به نرخ سیاستی بالاتر میانجامد. پیام مالی دقیق است. استنتاج سریعتر یک ورودی عملیاتی را بهتر میکند، اما همزمان hurdle rate دیتاسنتر، شتابدهنده و تعهد نرمافزاری ممکن است بالا برود. پروژه فقط زمانی ارزش میسازد که utilization، درآمد یا هزینه اجتنابشده پس از فرض واقعبینانه کیفیت و تقاضا، از استهلاک، انرژی، نیروی کار و تأمین مالی بیشتر باشد.
گزارش تراز پرداختهای ژوئن ژاپن نشان میدهد چرا نباید از روایت AI رونقی بیاصطکاک نتیجه گرفت. حساب جاری تعدیلنشده از مازاد ۱٫۲۸۱۸ تریلیون ین در سال قبل به کسری ۹۲٫۳ میلیارد ین رسید. حساب جاری تعدیلشده فصلی با ۱٫۳۹۶۹ تریلیون ین همچنان مازاد داشت، اما ۵۴٫۴ درصد پایینتر از ۳٫۰۶۴۵ تریلیون ین ماه مه بود. صادرات با رشد سالانه ۱۶٫۳ درصد به ۱۰٫۴۸۰۱ تریلیون ین رسید و واردات با رشد ۲۴٫۳ درصدی به ۱۰٫۶۱۵۳ تریلیون افزایش یافت؛ در نتیجه کسری کالایی ۱۳۵٫۲ میلیارد ین شد. مازاد درآمد اولیه نیز از ۱٫۴۴۴۹ تریلیون ین سال قبل به ۳۸۰٫۱ میلیارد رسید. جریان ماهانه با زمانبندی پرداخت، نرخ ارز و تعدیل فصلی نوسان میکند؛ پس این تیتر قیدی برای بررسی است، نه شاهد اینکه AI افت را ایجاد کرده است.
جزئیات خدمات نیز به همان اندازه آموزنده و مستعد تفسیر افراطیاند. ژاپن در هزینه استفاده از مالکیت فکری مازاد ۲۸۹٫۵ میلیارد ین ثبت کرد که از ۱۴۲٫۵ میلیارد سال قبل بیشتر بود؛ خدمات مخابرات، رایانه و اطلاعات نیز کسری ۳۷٫۳ میلیارد ینی داشت که از ۱۳۲٫۱ میلیارد کمتر شده بود. این طبقههای گسترده بسیار فراتر از AI هستند و صادرات مدل، درآمد استنتاج یا سودآوری دیتاسنتر را اندازه نمیگیرند. اما نشان میدهند جریانهای دیجیتال و دانشمحور در یک ماه میتوانند جهتهای متفاوت داشته باشند. برای اپراتور یا سرمایهگذار AI، حساب ملی یک لایه زمینه است: برای آزمون ادعای درآمد خارجی و نهاده وارداتی مفید، اما بدون شواهد درآمد، هزینه و جریان نقدی در سطح شرکت برای انتساب عملکرد ناکافی است.
مشاهده داخلی وزنه دوم را فراهم میکند. نظرسنجی Economy Watchers ژوئیه دفتر کابینه، شاخص وضعیت جاری را ۱٫۷ واحد به ۴۵٫۷ و شاخص چشمانداز دو تا سه ماه آینده را ۰٫۱ واحد به ۴۵٫۸ رساند. جهت بهتر شد، اما هر دو عدد زیر مرز خنثی ۵۰ ماندند. نظرسنجی از ۲۵ ژوئیه تا پایان ماه، ۱۸۱۱ پاسخ از ۲۰۵۰ مشاهدهگر واجد شرایط گرفت؛ نرخ پاسخ ۸۸٫۳ درصد. ارزیابی از نشانههای بهبود گفت، اما تضعیف احساس ناشی از وضعیت خاورمیانه و نگرانی پس از زلزله کوماموتو را نیز ذکر کرد. این سنجش سریع ادراک است، نه داده سخت تولید یا مصرف. بنابراین باید چرخه قدرتمند سرمایه جهانی AI را از انتقال کندتر و ناهمگون آن به خانوار و کسبوکار محلی جدا کرد.
مجموع اسناد یک فهرست پیگیری منضبط میسازد. مهندسان باید بهبود CUDA را روی GPU، مدل، batch، طول context، محدودیت توان و آزمون کیفیت متنوع بازتولید کنند و مسیر Q5_0 در SpaceMiT را فراتر از سه مدل بسنجند. اپراتورها باید این اندازهگیریها را به utilization، نرخ خطا، برق و هزینه کامل سرویس وصل کنند. ناظران کلان باید ببینند دادههای بعدی تجارت، خدمات و درآمد اولیه ژاپن فشردگی ژوئن را معکوس میکند یا نه؛ Economy Watchers از ۵۰ عبور میکند یا نه؛ و آیا تصمیم بعدی BOJ دیدگاههای شرطی را به مسیر نرخ متفاوت تبدیل میکند. تز عمداً محدود است: زیرساخت نرمافزاری استنتاج بهینهتر و قابلاعتمادتر میشود، اما تقاضای قویتر AI میتواند قیمت ظرفیت فیزیکی و پول را نیز بالا ببرد. سامانه برنده آنی است که اقتصاد واحد تأییدشدهاش سریعتر از hurdle سرمایه بهبود یابد، نه آنکه بزرگترین عدد منفرد بنچمارک را نمایش دهد.
منابع و اسناد
- 01Release b10330: CUDA Fuse RMSNorm, Multiply and RoPEllama.cpp · ۱۷ مرداد ۱۴۰۵
- 02Release b10333: Fix Missing Q5_0 Dispatch in SpaceMiT Backendllama.cpp · ۱۸ مرداد ۱۴۰۵
- 03Summary of Opinions at the Monetary Policy Meeting on July 30 and 31, 2026Bank of Japan · ۱۹ مرداد ۱۴۰۵
- 04Balance of Payments for June and First Half of 2026 (Preliminary)Japan Ministry of Finance and Bank of Japan · ۱۹ مرداد ۱۴۰۵
- 05Economy Watchers Survey: July 2026Cabinet Office of Japan · ۱۹ مرداد ۱۴۰۵
برچسبها
اخبار مرتبط

تقاضای AI اثبات شد؛ دسترسی و نقدینگی همچنان دروازهبانی میشوند
سه سند اولیه تازه، انکار تقاضای AI را دشوارتر و سادهسازی اقتصاد آن را خطرناکتر میکند. Anthropic قابلیتهای دفاع سایبری Claude Mythos 5 را با خروجیهای محدود، دسترسی احرازشده و تأیید اجباری انسان گسترش میدهد، نه با دسترسی نامحدود به مدل. Alibaba رشد ۴۵ درصدی درآمد AI Cloud and Compute تا ۴۸٫۴۴ میلیارد یوان و ۱۲٫۳۸ میلیارد یوان درآمد محصولات مرتبط با AI را گزارش کرد؛ همزمان مخارج سرمایهای فصل ۷۵ درصد بالا رفت و به ۶۷٫۶۸ میلیارد یوان رسید و جریان نقد آزاد غیر GAAP منفی ۴۴٫۶۷ میلیارد یوان بود. سفارشهای صادراتی ژوئیه تایوان نیز با رشد سالانه ۶۱٫۹ درصدی به رکورد ۹۷٫۹۴ میلیارد دلار رسید و خط لوله فیزیکی تقاضا را تأیید کرد. اما ضعف حجم خردهفروشی بریتانیا و استقراض عمومی بالاتر از پیشبینی نشان میدهد این چرخه سرمایهگذاری معادل قدرت فراگیر اقتصاد نیست. پرسش عملیاتی دیگر وجود تقاضا نیست؛ کنترل دسترسی، تأمین مالی ظرفیت و تبدیل مصرف به نقد پایدار است.

وضعیت عاملها حسابرسیپذیر میشود؛ سختافزار AI تقاضا را به جریان نقدی تبدیل میکند
در ۱۹ اوت دو لایه اقتصاد AI به سمت شواهد سختگیرانهتر حرکت کردند. نسخه ۰٫۲۲٫۰ کیت عاملهای OpenAI چند مسیر «موفقیت کاذب» و آلودگی وضعیت را بست: خروجی ابزاری که نگهبان خروجی رد کرده از وضعیت قابل بازپخش حذف میشود، پاسخ نهایی ناموفق یا ناقص دیگر به شکل موفقیتِ خالی ظاهر نمیشود و نقاط بازیابی مستقل مجموع مصرف مشترک و تغییرپذیر ندارند. در سوی مالی، Analog Devices رکورد ۴٫۰۲ میلیارد دلار درآمد فصلی و ۴٫۹۴ میلیارد دلار جریان نقدی آزاد دوازدهماهه را گزارش کرد و ارقام تعدیلشده را از GAAP جدا نگه داشت. صورتجلسه فدرال رزرو و تورم تازه بریتانیا و منطقه یورو نشان میدهد چرا این تمایز مهم است: پروژه AI باید در برابر سرمایه گران و حساس به انرژی، هم قابلیت اتکا و هم تبدیل تقاضا به نقدینگی را اثبات کند.

ONNX استقرار را از GPU جدا میکند؛ نردبان شغلی کره هزینه تعدیل را میپردازد
نسخه ۱٫۲۸٫۱ ONNX Runtime میتواند مدلهای WebGPU را در نشست صرفاً کامپایل، بدون دسترسی به سختافزار GPU تبدیل و ذخیره کند؛ نخستین انتشار جداگانه CUDA Plugin EP نیز ارائهدهنده شتابدهنده را به بخشی ماژولارتر از زماناجرای مدل تبدیل کرده است. این انتشارها یک نوع تعهد را سبکتر میکنند، اما شواهد تازه کره نشان میدهد انعطاف فنی به معنای پذیرش بیهزینه نیست: بانک کره میگوید اشتغال جوانان در چهار سال ۲۸۵ هزار نفر کاهش یافته و ۲۶۸ هزار مورد از این افت در صنایع با مواجهه بالای AI رخ داده است، با این هشدار صریح که مواجهه، علتبودن AI را ثابت نمیکند. تولید ژوئیه آمریکا نیز انتخابی بود؛ تولید تجهیزات کسبوکار ۰٫۸ درصد بالا رفت، درحالیکه بهرهبرداری از ظرفیت کل ۳٫۱ واحد درصد زیر میانگین بلندمدت ماند، و مجوزهای مسکن ۵٫۰ درصد افزایش یافت اما شروع ساخت ۱۲٫۴ درصد افت کرد. مانده موقت اعتبار خانوار کره نیز در سهماهه دوم ۲۵٫۹ تریلیون وون افزایش یافت. سیگنال مشترک، شکاف تعهد است: نرمافزار پیش از رسیدن سختافزار گزینههای بیشتری را باز نگه میدارد، ولی بنگاه، نیروی کار و وامگیرنده همچنان ریسک نابرابر تبدیل و گذار را میپردازند.