۱۹ مرداد ۱۴۰۵

استنتاج هوش مصنوعی بهینه‌تر می‌شود؛ تقاضا سرمایه را بازقیمت‌گذاری می‌کند

استنتاج هوش مصنوعی بهینه‌تر می‌شود؛ تقاضا سرمایه را بازقیمت‌گذاری می‌کند

پنجره انتشار امروز شکاف مهمی را میان بهره‌وری محاسبات و قیمت سرمایه آشکار می‌کند. دو به‌روزرسانی llama.cpp بهبودهایی محدود اما عینی در استنتاج ایجاد کردند: یکی چند عملیات CUDA را در یک کرنل ادغام کرد و در آزمون‌های اجراشده توسط مشارکت‌کننده روی RTX 5090 حدود یک درصد بهبود نشان داد؛ دیگری dispatch جاافتاده یک قالب کوانتیزه را روی سخت‌افزار SpaceMiT بازگرداند و خروجی مخدوش را اصلاح کرد. هیچ‌کدام جهش عمومی هزینه را اثبات نمی‌کنند. در سطح کلان، تازه‌ترین خلاصه دیدگاه‌های بانک ژاپن تقاضای جهانی AI را پشتیبان رشد و در عین حال نیرویی بالقوه برای افزایش فعالیت، قیمت‌ها و مسیر نرخ می‌داند و تعدیل سهام ناشی از افت انتظارات سودآوری AI را ریسک نزولی می‌شمارد. حساب‌های خارجی ژوئن ژاپن و نظرسنجی Economy Watchers ژوئیه نیز قید مهمی می‌گذارند: مازاد حساب جاری تعدیل‌شده فصلی ۵۴٫۴ درصد نسبت به ماه قبل افت کرد و هر دو شاخص وضعیت جاری و چشم‌انداز، با وجود بهبود، زیر مرز خنثی ۵۰ ماندند. نتیجه ZharfAI این است که استنتاج بهینه‌تر ارزش دارد، اما اقتصاد بار کاری همچنان باید از هزینه انرژی، سخت‌افزار، تورم و تأمین مالی عبور کند.


تحلیل ژرف‌ای‌آی

مهم‌ترین پیوند در پنجره شواهد ۳۰ تا ۴۸ ساعته، عرضه پرزرق‌وبرق یک مدل نیست؛ تنش میان دو تغییر کوچک در موتور استنتاج و یک بانک مرکزی است که تقاضای AI را آشکارا نیروی کلان اقتصادی می‌داند. نسخه‌های b10330 و b10333 از llama.cpp نشان می‌دهند مهندسان با چه سرعتی می‌توانند مرز یک کرنل را حذف یا dispatch یک شتاب‌دهنده را اصلاح کنند. خلاصه دیدگاه‌های ۱۰ اوت بانک ژاپن نیز توضیح می‌دهد چرا این بهبودها اقتصاد پروژه را قطعی نمی‌کنند: سرمایه‌گذاری AI می‌تواند تولید و قیمت را تقویت کند، بر سرعت عادی‌سازی نرخ اثر بگذارد و اگر سود مورد انتظار محقق نشود ریسک نزولی بسازد. داده تازه حساب‌های خارجی و احساس محلی ژاپن نیز نقش آزمون واقعیت را دارد، نه جشن پیروزی. این شماره تا حد ممکن در پنجره ۳۰ ساعته می‌ماند و فقط برای نسخه CUDA هشتم اوت، منتشرشده ۳۶ ساعت پیش از این گزارش، به چرخه مهندسی جهانی اخیر امتداد می‌یابد.

نسخه b10330 عملیات RMS normalization، ضرب، rotary positional embedding و در موارد مرتبط view و row selection را در یک کرنل CUDA ادغام کرد. تغییر مرتبط ۳۴۴ سطر افزوده در چهار فایل، مقایسه ۷۲ عملیات backend با خروجی CPU و عبور مجموعه آزمون پروژه و بررسی حافظه را گزارش می‌کند. در RTX 5090 با CUDA 13.3، اجرای Qwen3-4B و Qwen3-30B-A3B با کوانتیزه Q4_K_M توسط مشارکت‌کننده، در چند مورد منتخب پردازش prompt و تولید توکن حدود یک درصد بهبود نشان داد. در یک نمونه تولید از ۳۷۳٫۰۲ به ۳۷۷٫۰۳ توکن در ثانیه رسید و در نمونه دیگر پردازش prompt با ۲۰۴۸ توکن از ۱۸۹۱۷٫۰۷ به ۱۹۱۲۸٫۳۰ افزایش یافت. کاهش تعداد launch و ترافیک حافظه میانی سازوکارهای معتبری‌اند، اما این‌ها نتایج خود پروژه روی یک GPU رده‌بالا، دو مدل کوانتیزه و بیست تکرارند؛ نه بنچمارک عمومی latency، انرژی یا هزینه cloud.

نسخه b10333 کوچک‌تر و از نظر عملیاتی هشداردهنده‌تر است. یک تغییر دو سطری در backend شرکت SpaceMiT، dispatch جاافتاده کوانتیزه Q5_0 را روی شتاب‌دهنده K3 بازگرداند. پیش از اصلاح، روشن کردن شتاب‌دهی متن مخدوش تولید می‌کرد؛ مشارکت‌کننده پس از اصلاح، خروجی عادی را در سه مدل آزموده‌شده گزارش کرد. همان سند می‌گوید استنتاج prompt تقریباً ۴۰ برابر نمونه بدون شتاب‌دهی بود، اما این مقایسه از نویسنده patch می‌آید، نه آزمایشگاه مستقل، و نسخه ماتریس گسترده بار کاری، کیفیت، توان یا حرارت ارائه نمی‌کند. درس ماندگار، تقدم صحت بر سرعت است: مسیری که خروجی غیرقابل‌استفاده می‌دهد، با هر throughput اسمی، ارزش اقتصادی صفر دارد. خلأ کوچک در پوشش dispatch می‌تواند سود سیلیکون تخصصی را تا آزمون دقیق ترکیب کوانتیزه و مدل از بین ببرد.

این دو نسخه دو شکل متفاوت از بهره‌وری استنتاج را نشان می‌دهند. ادغام کرنل به‌دنبال بهبود حاشیه‌ای throughput و ترافیک حافظه روی مسیر بالغ و بسیار سریع GPU است؛ اصلاح dispatch یک شتاب‌دهنده edge را اساساً قابل‌استفاده می‌کند. هیچ‌کدام اجازه نمی‌دهد بگوییم AI به‌طور عمومی یک درصد یا ۴۰ برابر ارزان‌تر شده است. هزینه هر نتیجه مفید به utilization، شکل batch و context، صحت عددی، تکرارها، ظرفیت حافظه، مصرف برق، زمان اپراتور و سهم عملیات تغییریافته از کل latency وابسته است. بهبود یک کرنل می‌تواند در سرویس دائمی و مقیاس بزرگ انباشته شود، اما پشت شبکه، بارگذاری مدل، sampling یا ظرفیت بیکار نیز محو می‌شود. تیم مالی به مخرج در سطح بار کاری نیاز دارد: خروجی تأییدشده به‌ازای هر وات‌ساعت و هر واحد پول با همه هزینه‌ها، نه تصویر اوج توکن بر ثانیه.

خلاصه دیدگاه‌های ۱۰ اوت بانک ژاپن این مخرج را وارد سیاست پولی می‌کند. اعضای هیئت نوشته‌اند تقاضای جهانی مرتبط با AI از رشد پشتیبانی می‌کند، ممکن است گسترده‌تر از انتظار در حال انتشار باشد و می‌تواند فعالیت اقتصادی و قیمت‌ها را بالاتر ببرد. چند دیدگاه در صورت تحقق چشم‌انداز از ادامه عادی‌سازی حمایت کردند و یک دیدگاه گفت سرعت افزایش نرخ سیاستی ممکن است از انتظار بازار بیشتر شود. دیگران ترجیح دادند در نشست ژوئیه نرخ ثابت بماند تا اثر افزایش قبلی و داده جدید سنجیده شود. این سند متن رأی‌به‌رأی یا جدول زمانی قطعی نیست؛ گزیده‌ای است که رئیس بانک از دیدگاه‌های جداگانه اعضای هیئت و نمایندگان دولت در نشست ۳۰ و ۳۱ ژوئیه تدوین کرده است. با این حال تأیید می‌کند تقاضای AI اکنون در بحث تورم، انتظارات و نرخ بهره بانک حضور دارد، نه فقط در پیش‌بینی بخش فناوری.

همان خلاصه، قوی‌ترین استدلال مخالف یک رونق بی‌قید سرمایه‌گذاری AI را ارائه می‌کند. یک دیدگاه هشدار می‌دهد اگر انتظار سودآوری AI کاهش یابد، تعدیل قیمت سهام می‌تواند فعالیت اقتصادی و قیمت‌ها را تضعیف کند. این ریسک شرطی است، نه پیش‌بینی سقوط. مسیر معکوس نیز ممکن است: تقاضای قوی‌تر از انتظار AI سرمایه‌گذاری و درآمد شرکت را بالا می‌برد، در حالی که فشار پایدار قیمت به نرخ سیاستی بالاتر می‌انجامد. پیام مالی دقیق است. استنتاج سریع‌تر یک ورودی عملیاتی را بهتر می‌کند، اما هم‌زمان hurdle rate دیتاسنتر، شتاب‌دهنده و تعهد نرم‌افزاری ممکن است بالا برود. پروژه فقط زمانی ارزش می‌سازد که utilization، درآمد یا هزینه اجتناب‌شده پس از فرض واقع‌بینانه کیفیت و تقاضا، از استهلاک، انرژی، نیروی کار و تأمین مالی بیشتر باشد.

گزارش تراز پرداخت‌های ژوئن ژاپن نشان می‌دهد چرا نباید از روایت AI رونقی بی‌اصطکاک نتیجه گرفت. حساب جاری تعدیل‌نشده از مازاد ۱٫۲۸۱۸ تریلیون ین در سال قبل به کسری ۹۲٫۳ میلیارد ین رسید. حساب جاری تعدیل‌شده فصلی با ۱٫۳۹۶۹ تریلیون ین همچنان مازاد داشت، اما ۵۴٫۴ درصد پایین‌تر از ۳٫۰۶۴۵ تریلیون ین ماه مه بود. صادرات با رشد سالانه ۱۶٫۳ درصد به ۱۰٫۴۸۰۱ تریلیون ین رسید و واردات با رشد ۲۴٫۳ درصدی به ۱۰٫۶۱۵۳ تریلیون افزایش یافت؛ در نتیجه کسری کالایی ۱۳۵٫۲ میلیارد ین شد. مازاد درآمد اولیه نیز از ۱٫۴۴۴۹ تریلیون ین سال قبل به ۳۸۰٫۱ میلیارد رسید. جریان ماهانه با زمان‌بندی پرداخت، نرخ ارز و تعدیل فصلی نوسان می‌کند؛ پس این تیتر قیدی برای بررسی است، نه شاهد اینکه AI افت را ایجاد کرده است.

جزئیات خدمات نیز به همان اندازه آموزنده و مستعد تفسیر افراطی‌اند. ژاپن در هزینه استفاده از مالکیت فکری مازاد ۲۸۹٫۵ میلیارد ین ثبت کرد که از ۱۴۲٫۵ میلیارد سال قبل بیشتر بود؛ خدمات مخابرات، رایانه و اطلاعات نیز کسری ۳۷٫۳ میلیارد ینی داشت که از ۱۳۲٫۱ میلیارد کمتر شده بود. این طبقه‌های گسترده بسیار فراتر از AI هستند و صادرات مدل، درآمد استنتاج یا سودآوری دیتاسنتر را اندازه نمی‌گیرند. اما نشان می‌دهند جریان‌های دیجیتال و دانش‌محور در یک ماه می‌توانند جهت‌های متفاوت داشته باشند. برای اپراتور یا سرمایه‌گذار AI، حساب ملی یک لایه زمینه است: برای آزمون ادعای درآمد خارجی و نهاده وارداتی مفید، اما بدون شواهد درآمد، هزینه و جریان نقدی در سطح شرکت برای انتساب عملکرد ناکافی است.

مشاهده داخلی وزنه دوم را فراهم می‌کند. نظرسنجی Economy Watchers ژوئیه دفتر کابینه، شاخص وضعیت جاری را ۱٫۷ واحد به ۴۵٫۷ و شاخص چشم‌انداز دو تا سه ماه آینده را ۰٫۱ واحد به ۴۵٫۸ رساند. جهت بهتر شد، اما هر دو عدد زیر مرز خنثی ۵۰ ماندند. نظرسنجی از ۲۵ ژوئیه تا پایان ماه، ۱۸۱۱ پاسخ از ۲۰۵۰ مشاهده‌گر واجد شرایط گرفت؛ نرخ پاسخ ۸۸٫۳ درصد. ارزیابی از نشانه‌های بهبود گفت، اما تضعیف احساس ناشی از وضعیت خاورمیانه و نگرانی پس از زلزله کوماموتو را نیز ذکر کرد. این سنجش سریع ادراک است، نه داده سخت تولید یا مصرف. بنابراین باید چرخه قدرتمند سرمایه جهانی AI را از انتقال کندتر و ناهمگون آن به خانوار و کسب‌وکار محلی جدا کرد.

مجموع اسناد یک فهرست پیگیری منضبط می‌سازد. مهندسان باید بهبود CUDA را روی GPU، مدل، batch، طول context، محدودیت توان و آزمون کیفیت متنوع بازتولید کنند و مسیر Q5_0 در SpaceMiT را فراتر از سه مدل بسنجند. اپراتورها باید این اندازه‌گیری‌ها را به utilization، نرخ خطا، برق و هزینه کامل سرویس وصل کنند. ناظران کلان باید ببینند داده‌های بعدی تجارت، خدمات و درآمد اولیه ژاپن فشردگی ژوئن را معکوس می‌کند یا نه؛ Economy Watchers از ۵۰ عبور می‌کند یا نه؛ و آیا تصمیم بعدی BOJ دیدگاه‌های شرطی را به مسیر نرخ متفاوت تبدیل می‌کند. تز عمداً محدود است: زیرساخت نرم‌افزاری استنتاج بهینه‌تر و قابل‌اعتمادتر می‌شود، اما تقاضای قوی‌تر AI می‌تواند قیمت ظرفیت فیزیکی و پول را نیز بالا ببرد. سامانه برنده آنی است که اقتصاد واحد تأییدشده‌اش سریع‌تر از hurdle سرمایه بهبود یابد، نه آن‌که بزرگ‌ترین عدد منفرد بنچمارک را نمایش دهد.


منابع و اسناد

  1. 01Release b10330: CUDA Fuse RMSNorm, Multiply and RoPEllama.cpp · ۱۷ مرداد ۱۴۰۵
  2. 02Release b10333: Fix Missing Q5_0 Dispatch in SpaceMiT Backendllama.cpp · ۱۸ مرداد ۱۴۰۵
  3. 03Summary of Opinions at the Monetary Policy Meeting on July 30 and 31, 2026Bank of Japan · ۱۹ مرداد ۱۴۰۵
  4. 04Balance of Payments for June and First Half of 2026 (Preliminary)Japan Ministry of Finance and Bank of Japan · ۱۹ مرداد ۱۴۰۵
  5. 05Economy Watchers Survey: July 2026Cabinet Office of Japan · ۱۹ مرداد ۱۴۰۵

برچسب‌ها

استنتاج هوش مصنوعیبهینه‌سازی CUDAرایانش لبهبانک ژاپننرخ بهرهتراز پرداخت‌هااقتصاد ژاپناقتصاد واحد

اخبار مرتبط

تقاضای AI اثبات شد؛ دسترسی و نقدینگی همچنان دروازه‌بانی می‌شوند
۳۱ مرداد ۱۴۰۵منبع: Alibaba Group

تقاضای AI اثبات شد؛ دسترسی و نقدینگی همچنان دروازه‌بانی می‌شوند

سه سند اولیه تازه، انکار تقاضای AI را دشوارتر و ساده‌سازی اقتصاد آن را خطرناک‌تر می‌کند. Anthropic قابلیت‌های دفاع سایبری Claude Mythos 5 را با خروجی‌های محدود، دسترسی احرازشده و تأیید اجباری انسان گسترش می‌دهد، نه با دسترسی نامحدود به مدل. Alibaba رشد ۴۵ درصدی درآمد AI Cloud and Compute تا ۴۸٫۴۴ میلیارد یوان و ۱۲٫۳۸ میلیارد یوان درآمد محصولات مرتبط با AI را گزارش کرد؛ هم‌زمان مخارج سرمایه‌ای فصل ۷۵ درصد بالا رفت و به ۶۷٫۶۸ میلیارد یوان رسید و جریان نقد آزاد غیر GAAP منفی ۴۴٫۶۷ میلیارد یوان بود. سفارش‌های صادراتی ژوئیه تایوان نیز با رشد سالانه ۶۱٫۹ درصدی به رکورد ۹۷٫۹۴ میلیارد دلار رسید و خط لوله فیزیکی تقاضا را تأیید کرد. اما ضعف حجم خرده‌فروشی بریتانیا و استقراض عمومی بالاتر از پیش‌بینی نشان می‌دهد این چرخه سرمایه‌گذاری معادل قدرت فراگیر اقتصاد نیست. پرسش عملیاتی دیگر وجود تقاضا نیست؛ کنترل دسترسی، تأمین مالی ظرفیت و تبدیل مصرف به نقد پایدار است.

وضعیت عامل‌ها حسابرسی‌پذیر می‌شود؛ سخت‌افزار AI تقاضا را به جریان نقدی تبدیل می‌کند
۲۹ مرداد ۱۴۰۵منبع: OpenAI Agents SDK

وضعیت عامل‌ها حسابرسی‌پذیر می‌شود؛ سخت‌افزار AI تقاضا را به جریان نقدی تبدیل می‌کند

در ۱۹ اوت دو لایه اقتصاد AI به سمت شواهد سخت‌گیرانه‌تر حرکت کردند. نسخه ۰٫۲۲٫۰ کیت عامل‌های OpenAI چند مسیر «موفقیت کاذب» و آلودگی وضعیت را بست: خروجی ابزاری که نگهبان خروجی رد کرده از وضعیت قابل بازپخش حذف می‌شود، پاسخ نهایی ناموفق یا ناقص دیگر به شکل موفقیتِ خالی ظاهر نمی‌شود و نقاط بازیابی مستقل مجموع مصرف مشترک و تغییرپذیر ندارند. در سوی مالی، Analog Devices رکورد ۴٫۰۲ میلیارد دلار درآمد فصلی و ۴٫۹۴ میلیارد دلار جریان نقدی آزاد دوازده‌ماهه را گزارش کرد و ارقام تعدیل‌شده را از GAAP جدا نگه داشت. صورت‌جلسه فدرال رزرو و تورم تازه بریتانیا و منطقه یورو نشان می‌دهد چرا این تمایز مهم است: پروژه AI باید در برابر سرمایه گران و حساس به انرژی، هم قابلیت اتکا و هم تبدیل تقاضا به نقدینگی را اثبات کند.

ONNX استقرار را از GPU جدا می‌کند؛ نردبان شغلی کره هزینه تعدیل را می‌پردازد
۲۸ مرداد ۱۴۰۵منبع: ONNX Runtime

ONNX استقرار را از GPU جدا می‌کند؛ نردبان شغلی کره هزینه تعدیل را می‌پردازد

نسخه ۱٫۲۸٫۱ ONNX Runtime می‌تواند مدل‌های WebGPU را در نشست صرفاً کامپایل، بدون دسترسی به سخت‌افزار GPU تبدیل و ذخیره کند؛ نخستین انتشار جداگانه CUDA Plugin EP نیز ارائه‌دهنده شتاب‌دهنده را به بخشی ماژولارتر از زمان‌اجرای مدل تبدیل کرده است. این انتشارها یک نوع تعهد را سبک‌تر می‌کنند، اما شواهد تازه کره نشان می‌دهد انعطاف فنی به معنای پذیرش بی‌هزینه نیست: بانک کره می‌گوید اشتغال جوانان در چهار سال ۲۸۵ هزار نفر کاهش یافته و ۲۶۸ هزار مورد از این افت در صنایع با مواجهه بالای AI رخ داده است، با این هشدار صریح که مواجهه، علت‌بودن AI را ثابت نمی‌کند. تولید ژوئیه آمریکا نیز انتخابی بود؛ تولید تجهیزات کسب‌وکار ۰٫۸ درصد بالا رفت، درحالی‌که بهره‌برداری از ظرفیت کل ۳٫۱ واحد درصد زیر میانگین بلندمدت ماند، و مجوزهای مسکن ۵٫۰ درصد افزایش یافت اما شروع ساخت ۱۲٫۴ درصد افت کرد. مانده موقت اعتبار خانوار کره نیز در سه‌ماهه دوم ۲۵٫۹ تریلیون وون افزایش یافت. سیگنال مشترک، شکاف تعهد است: نرم‌افزار پیش از رسیدن سخت‌افزار گزینه‌های بیشتری را باز نگه می‌دارد، ولی بنگاه، نیروی کار و وام‌گیرنده همچنان ریسک نابرابر تبدیل و گذار را می‌پردازند.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما