۶ شهریور ۱۴۰۵

ظرفیت AI لایه‌لایه می‌شود؛ قراردادها بار سرمایه را حمل می‌کنند

ظرفیت AI لایه‌لایه می‌شود؛ قراردادها بار سرمایه را حمل می‌کنند

دو سند از دو لایه متفاوت زنجیره AI یک پرسش مشترک را دقیق‌تر می‌کنند: چه مقدار از ظرفیت کمیاب را می‌توان به خدمت مفید و قابل‌تأمین مالی تبدیل کرد؟ vLLM 0.28.0 برای KV cache استنتاج، انتقال به دیسک و لایه دوم قابل‌گسترش را اضافه کرده و هم‌زمان روی سرعت و حافظه مدل‌های مشخص کار کرده است. در سوی فیزیکی، IREN می‌گوید ظرفیت ۲۰۲۶ تقریباً فروخته شده و ۴ میلیارد دلار درآمد سالانه‌شده قراردادی اعلام می‌کند، اما امروز فقط ۱ میلیارد دلار آن عملیاتی است؛ ARR سنجه عملیاتی خود شرکت است، نه درآمد GAAP، و درآمد شناسایی‌شده می‌تواند بسیار کمتر باشد. توسعه شرکت با پیش‌پرداخت مشتری و بدهی GPU با نرخ ۶ یا ۹ درصد پیش می‌رود و تعهدات نزدیک‌مدت آن به ۱۳٫۶ میلیارد دلار رسیده است. بانک مرکزی ژاپن نیز تقاضای جهانی AI را هم‌زمان محرک رشد و قیمت می‌داند و بر نقش نرخ بهره در تخصیص منابع کمیاب تأکید می‌کند. جمع‌بندی ژرف: لایه‌بندی نرم‌افزار می‌تواند سخت‌افزار نصب‌شده را کش بیاورد و قراردادها توسعه آن را تأمین مالی کنند؛ اما هیچ‌کدام ریسک بهره‌برداری، تحویل، کهنگی، طرف قرارداد یا هزینه سرمایه را حذف نمی‌کنند.


تحلیل ژرف

قوی‌ترین تحول این پنجره خبری یک رونمایی مدل یا تیتر درآمدی منفرد نیست؛ شکل‌گرفتن سلسله‌مراتب روشن‌تری برای ظرفیت است. در لایه نرم‌افزار، vLLM 0.28.0 حافظه استنتاج را لایه‌لایه‌تر می‌کند: مسیر داغ GPU اکنون می‌تواند به لایه دوم KV cache روی دیسک متصل شود و مدیرهای بیرونی نیز بدون قرارگرفتن در هسته پروژه افزوده شوند. در لایه زیرساخت، IREN از قرارداد مشتری، پیش‌پرداخت و تأمین مالی متکی به دارایی استفاده می‌کند تا GPU و مرکز داده را زودتر وارد خدمت کند. هر دو سازوکار می‌خواهند منبعی کمیاب را پربازده‌تر کنند. هر دو نیز ریسک را جابه‌جا می‌کنند، نه اینکه آن را از بین ببرند: ذخیره‌سازی کندتر وارد بودجه تأخیر می‌شود و ظرفیت قراردادی آینده وارد برنامه ساخت، پذیرش و خدمت بدهی.

انتشار ۲۶ اوت vLLM جزئیات عملی کم‌سابقه‌ای دارد. کار روی KV cache لایه‌ای شامل انتقال به دیسک، مدیرهای لایه دوم خارج از پروژه که با module path بارگذاری می‌شوند، بازیابی جزئی از لایه دوم، سنجه‌های پایش لایه‌بندی و چیدمان استاندارد CPU مستقل از روش موازی‌سازی است. ایده عملی روشن است: به‌جای آنکه هر نبود داده در cache به باز‌محاسبه کامل منجر شود، حالت attention قابل‌استفاده مجدد بیرون از حافظه کمیاب شتاب‌دهنده نگه داشته شود. این قابلیت می‌تواند اقتصاد درخواست‌های تکراری یا زمینه بلند را بهتر کند، اما دیسک را به حافظه GPU تبدیل نمی‌کند. اپراتور باید نرخ اصابت، پهنای‌باند انتقال، تأخیر دنباله، رقابت برای ذخیره‌سازی و سهم درخواست‌های واقعاً منتفع را با توزیع prompt خود اندازه بگیرد.

همین نسخه مجموعه بزرگی از بهینه‌سازی‌های Kimi-K3 را گزارش می‌کند؛ از kernelهای ترکیبی و موازی‌سازی زمینه decode تا بودجه تطبیقی توکن speculative. نگه‌دارندگان از حدود ۶۰ درصد بهبود زمان رسیدن اولین توکن در یک مسیر DSpark و نزدیک ۱۷ گیگابایت صرفه‌جویی حافظه به‌ازای هر GPU با تقسیم اختیاری shared expert خبر می‌دهند. این‌ها اعداد گزارش‌شده مشارکت‌کنندگان برای مؤلفه و پیکربندی مشخص‌اند، نه benchmark مستقل یک ناوگان یا وعده کاهش ۶۰ درصدی هزینه استنتاج. PyPI دقایقی بعد بسته‌ها را منتشر کرد. استقرار تولید همچنان به آزمون سازگاری، صحت، امنیت و رگرسیون هر workload نیاز دارد.

پرونده ۲۷ اوت IREN نشان می‌دهد همین مسئله ظرفیت در مقیاس دلار و مگاوات چه شکلی دارد. شرکت می‌گوید ظرفیت ۲۰۲۶ تقریباً فروخته شده و برای ظرفیت هدف‌گذاری‌شده آن سال ۴ میلیارد دلار درآمد سالانه‌شده قراردادی گزارش می‌کند؛ در برابر ۱ میلیارد دلار ARR عملیاتی در ۲۶ اوت. این فاصله تعیین‌کننده است. IREN، ARR را حاصل ضرب قیمت قراردادی ساعت GPU در ۸٬۷۶۰ ساعت، به‌علاوه درآمد سالانه‌شده ذخیره‌سازی و خدمات جانبی تعریف می‌کند. این یک سنجه عملیاتی است، نه معیار US GAAP؛ خود شرکت صریحاً هشدار می‌دهد درآمد شناسایی‌شده می‌تواند به‌طور معنادار کمتر باشد. ظرفیت باید راه‌اندازی، آزمایش و پذیرفته شود و درآمد فقط پس از عبور از این دروازه‌ها رشد می‌کند.

ساختار تأمین مالی سهم نقدی سهام‌دار را کمتر می‌کند، اما اجرای پروژه را دوقطبی‌تر می‌سازد. IREN می‌گوید بسته ۳٫۶ میلیارد دلاری برای قرارداد Microsoft نرخ موزون ۶ درصد دارد و همراه پیش‌پرداخت‌ها ۹۶ درصد مخارج سرمایه‌ای GPU مرتبط را پوشش می‌دهد. تأمین مالی تازه برای استقرارهای دیگر ۲٫۸ میلیارد دلار است؛ بخشی ۲٫۴ میلیارد دلاری با هدایت Blue Owl و سرمایه‌گذاران تحت مشاوره PIMCO نرخ ثابت ۹ درصد دارد و ۹۰ درصد مخارج GPU مرتبط را تأمین می‌کند. پیش‌پرداخت مشتریان اخیر معادل ۴۵ تا ۵۵ درصد مخارج برآوردی GPU بوده است. این تقسیم ریسک است، نه سرمایه رایگان: بهره و بازپرداخت باقی می‌مانند و عملکرد قرارداد پشتوانه تأمین مالی می‌شود.

نتایج حسابرسی‌شده بار تبدیل را آشکار می‌کنند. درآمد AI Cloud Services در سال مالی ۲۰۲۶ از ۱۶٫۴ به ۱۲۸٫۸ میلیون دلار رسید؛ نزدیک به هشت برابر، درحالی‌که کل درآمد ۷۰۷٫۰ میلیون دلار بود. بااین‌حال شرکت زیان خالص ۷۰۲٫۶ میلیون دلاری ثبت کرد؛ در برابر سود خالص ۸۶٫۹ میلیون دلاری سال قبل. این زیان شامل ۶۳۸٫۸ میلیون دلار کاهش ارزش غیرنقدی بود که عمدتاً به کنارگذاشتن سخت‌افزار استخراج بیت‌کوین هنگام تبدیل سایت‌ها برای AI cloud مربوط می‌شد. این قید بخش عمده چرخش را توضیح می‌دهد، اما هزینه اقتصادی کنارگذاری را بی‌اهمیت نمی‌کند. تعهدات قراردادی در ۳۰ ژوئن ۱۳٫۸۱۰ میلیارد دلار بود که ۱۳٫۶۱۱ میلیارد دلار آن ظرف ۱۲ ماه سررسید داشت؛ در برابر ۳۶۸٫۸ میلیون دلار یک سال قبل. به گفته مدیریت، نقد موجود، تأمین مالی متعهدشده GPU و پیش‌پرداخت‌ها جمعاً ۱۴ میلیارد دلار بود، اما هماهنگ‌کردن زمان قرارداد، capex، برق و تأمین مالی اکنون مأموریت عملیاتی اصلی است.

بانک مرکزی ژاپن خوانشی کلان از بیرون حلقه فروشنده و سرمایه‌گذار ارائه می‌کند. ریوزو هیمینو، معاون بانک، در سخنرانی ۲۷ اوت تقاضای جهانی AI را نیروی رو به بالا برای فعالیت اقتصادی و قیمت‌ها دانست. او برآورد کرد پنج hyperscaler در ۲۰۲۶ می‌توانند ۰٫۸ تریلیون دلار سرمایه‌گذاری کنند، به رشد قیمت صادرات مرتبط با AI ژاپن اشاره کرد و سرریز آن را به تجهیزات نیمه‌رسانا، ابزار دقیق، مس و تأمین‌کنندگان محلی توضیح داد. نرخ سیاستی ژاپن پس از افزایش ژوئن به ۱ درصد رسیده، درحالی‌که نرخ‌های واقعی منفی و شرایط مالی تسهیل‌گر مانده‌اند. نتیجه او ادامه افزایش نرخ متناسب با فعالیت، قیمت و شرایط مالی بود؛ با این استدلال که در کمبود نیروی کار و مواد، نرخ بهره باید سرمایه‌گذاری کارآمد و راهبردی را در اولویت بگذارد.

این سخنرانی ثابت نمی‌کند تقاضای AI علت مسیر نرخ ژاپن است. هیمینو نفت، ین، دستمزد، یارانه‌های موقت و تورم زیربنایی را نیز بررسی کرد و سیاست پولی به چشم‌انداز ترکیبی پاسخ می‌دهد. برداشت محدودتر مفیدتر است: ساخت زیرساخت AI می‌تواند صادرات و سرمایه‌گذاری را تقویت کند و هم‌زمان قیمت حافظه، مس، تجهیزات و کالاهای بادوام را بالا ببرد. صرفه‌جویی نرم‌افزاری در سطح سرور درون سیستمی رخ می‌دهد که برق، زمین، نیروی ماهر و سرمایه در آن ممکن است گران‌تر شوند. کاهش هزینه هر توکن با کاهش هزینه موزون کل خدمت یکسان نیست.

حساب‌های ملی آمریکا نیز ضرورت تفکیک سود و سرمایه‌گذاری نیرومند از رشد گسترده و بی‌اصطکاک را نشان می‌دهد. اداره تحلیل اقتصادی رشد واقعی GDP فصل دوم را با نرخ سالانه ۱٫۵ درصد بدون تغییر نگه داشت. فروش نهایی واقعی به خریداران خصوصی داخلی ۴٫۲ درصد رشد کرد، اما شاخص قیمت خرید ناخالص داخلی با نرخ سالانه ۵٫۸ درصد و قیمت هسته PCE با نرخ ۳٫۶ درصد افزایش یافت. سود حاصل از تولید جاری پس از رشد ۷۴٫۴ میلیارد دلاری فصل اول، ۴۰۰٫۹ میلیارد دلار بالا رفت. این برآوردهای بازبینی‌پذیر کل اقتصاد سنجه AI نیستند؛ آن‌ها تقاضای خصوصی را کنار فشار قیمت نشان می‌دهند، پس سرمایه ممکن است موجود باشد اما انضباط اعتبارسنجی مهم می‌ماند.

جمع‌بندی عملی یک آزمون تبدیل سه‌مرحله‌ای است. نخست، نرم‌افزار را با کار مفید کامل‌شده بسنجید: درخواست‌های پاسخ‌داده‌شده در سقف تأخیر، نه سرعت تیترشده kernel یا ظرفیت اسمی cache. دوم، قرارداد زیرساخت را با مگاوات راه‌اندازی‌شده، شتاب‌دهنده پذیرفته‌شده، بهره‌برداری، جریمه خدمت و درآمد شناسایی‌شده بیازمایید، نه ARR قراردادی. سوم، تأمین مالی را در برابر بهره، تعهدات وام، اعتبار مشتری و عمر مفید سخت‌افزار قرار دهید. لایه دوم cache می‌تواند ارزش GPU را افزایش دهد و پیش‌پرداخت نیاز به سرمایه بیرونی را کم کند؛ هیچ‌کدام تضمین نمی‌کند تقاضا طبق برنامه برسد یا تجهیزات هزینه سرمایه خود را پوشش دهند.

گام بعدی قابل‌اندازه‌گیری است. اپراتورهای vLLM باید برای نسخه 0.28.0 توزیع تأخیر، نرخ اصابت لایه cache، رفتار هنگام خطا و هزینه کل را منتشر کنند. IREN باید فاصله ۴ میلیارد دلار ARR قراردادی تا ۱ میلیارد دلار ARR عملیاتی را به ظرفیت پذیرفته‌شده و درآمد GAAP تبدیل کند، ۱۳٫۶ میلیارد دلار تعهد نزدیک‌مدت را اجرا کند و پوشش تأمین مالی ۹ درصدی GPU را نشان دهد. تمرکز مشتری، پیش‌پرداخت، تحویل برق، ساخت، کاهش ارزش و تأمین مالی مجدد مهم‌تر از عبارت ظرفیت فروخته‌شده‌اند. بانک‌های مرکزی نیز می‌سنجند بهره‌وری AI با چه سرعتی فشار آن بر نهاده‌های کمیاب را جبران می‌کند. شواهد امروز خوش‌بینی منضبط را توجیه می‌کند: ظرفیت انعطاف‌پذیرتر و قابل‌تأمین مالی‌تر شده، اما اقتصاد آن در نقاط تبدیل به دست می‌آید، نه هنگام امضای قرارداد.


منابع و اسناد

  1. 01Release v0.28.0vLLM Project · ۴ شهریور ۱۴۰۵
  2. 02vllm 0.28.0Python Package Index · ۴ شهریور ۱۴۰۵
  3. 03IREN Reports FY26 ResultsU.S. Securities and Exchange Commission · ۵ شهریور ۱۴۰۵
  4. 04IREN Limited Annual Report for the Year Ended June 30, 2026U.S. Securities and Exchange Commission · ۵ شهریور ۱۴۰۵
  5. 05Japan’s Economy and Monetary PolicyBank of Japan · ۵ شهریور ۱۴۰۵
  6. 06GDP (Second Estimate) and Corporate Profits, 2nd Quarter 2026U.S. Bureau of Economic Analysis · ۴ شهریور ۱۴۰۵

برچسب‌ها

موتور استنتاج vLLMزیرساخت استنتاجحافظه KV cacheابر AIمرکز دادهتأمین مالی GPUنرخ بهرهتخصیص سرمایه

اخبار مرتبط

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
۲۶ شهریور ۱۴۰۵منبع: NVIDIA

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند

گوگل، انویدیا و امرالد ای‌آی ائتلافی ساخته‌اند که می‌خواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویل‌شده یا قاعده الزام‌آور نیست. ژرف بررسی می‌کند چنین وعده‌ای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کم‌کردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمی‌کند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یک‌چهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیم‌گر، عملکرد اندازه‌گیری‌شده و مسئولیت روشن هزینه‌ها، معیارهای بعدی‌اند؛ نه صرف حمایت شرکت‌ها.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما