۳ شهریور ۱۴۰۵

WebGPU لبه مرورگر را باز می‌کند؛ علی‌بابا بهای سرمایه AI را آشکار می‌کند

WebGPU لبه مرورگر را باز می‌کند؛ علی‌بابا بهای سرمایه AI را آشکار می‌کند

نسخه ۰٫۳٫۰ افزونه WebGPU در ONNX Runtime مسیر عملی اجرای مدل‌های مولد روی WebGPU را گسترده‌تر کرد: پشتیبانی اولیه PagedAttention، کش KV کوانتیزه، توجه گروهی گسترده‌تر، dispatch معوق برای shader و پوشش عملگرهای بیشتر به آن افزوده شد. بااین‌حال انتشار هیچ بنچمارک عمومی ارائه نمی‌کند و یادداشت‌های آن با کمک AI نوشته شده‌اند؛ پس ادعای تولید باید مستقل آزموده شود. در سوی مالی، علی‌بابا ۷۱۰ میلیون سهم جدید را با قیمت ۱۱۲٫۷۰ دلار هنگ‌کنگ قیمت‌گذاری کرد، حدود ۷۹٫۷ میلیارد دلار هنگ‌کنگ خالص انتظار دارد و می‌خواهد ۱۰۰ درصد آن را صرف توانمندی و زیرساخت تمام‌پشته AI کند. در صورت تکمیل معامله مشروط، سهم جدید حدود ۳٫۵۷ درصد تعداد سهام پس از افزایش خواهد بود. افت حجم خرده‌فروشی نیوزیلند و شاخص فعالیت ژوئیه فدرال‌رزرو شیکاگو نیز نشان می‌دهد توزیع گسترده‌تر AI در محیط تقاضای گزینشی رخ می‌دهد. این رویدادها علت یکدیگر نیستند؛ پیام مشترک این است که دسترسی بازتر می‌شود و انضباط سرمایه دیگر به‌سادگی پنهان نمی‌ماند.


تحلیل ژرف

روشن‌ترین سیگنال AI در تازه‌ترین چرخه انتشار جهانی، یک جدول رتبه‌بندی مدل دیگر نیست. مایکروسافت در ۲۴ اوت ساعت ۲۱:۴۴:۲۵ UTC نسخه ۰٫۳٫۰ افزونه WebGPU Execution Provider در ONNX Runtime را منتشر کرد؛ انتشاری سیستمی که هدفش اجرای گراف مدل‌های بیشتر و اتکاپذیرتر روی دستگاه‌های دارای WebGPU است. اهمیت آن از این واقعیت می‌آید که توزیع اغلب در لایه‌ای پایین‌تر از مدل متوقف می‌شود: عملگر پشتیبانی‌نشده، قالب کش، زمان کامپایل shader یا kernel وابسته به دستگاه می‌تواند مدلی ظاهراً قابل‌حمل را از تبدیل‌شدن به محصول محلی یا نزدیک به مرورگر بازدارد. نسخه تازه هم‌زمان چند مانع را هدف می‌گیرد، اما باید آن را سطح استقرار گسترده‌تر دانست، نه اثبات سرعت هر مدل روی هر دستگاه.

برای workload مولد، انتشار پشتیبانی اولیه PagedAttention، کش key-value کوانتیزه و مسیر گسترده‌تر grouped-query attention را اضافه کرده که کش پنجره لغزان، promptهای batch‌شده با right padding و ضبط گراف FlashAttention برای Gemma 4 را پوشش می‌دهد. پشتیبانی دو‌بیتی GatherBlockQuantized، ادغام ONNX 1.22 با opset 27 و پشتیبانی گسترده‌تر از اعداد صحیح در عملگرهای رایج نیز افزوده شده است. این تغییرات زیرساختی پیامد مالی دارند: کش کوچک‌تر یا بهتر مدیریت‌شده می‌تواند فشار حافظه را کم کند و پوشش عملگر بیشتر، fallback یا کار یکپارچه‌سازی سفارشی را کاهش دهد. بااین‌حال واژه «اولیه» مهم است. وجود یک عملگر، برابری عددی، کارایی حافظه یا latency مفید سرتاسری را برای مدل و دستگاه مشخص ثابت نمی‌کند.

شروع سرد و تخصصی‌سازی سخت‌افزار نیز مورد توجه بوده است. deferred dispatch می‌تواند کامپایل shader را موازی کند و انتشار، kernelهای MatMul با subgroup matrix و Gemm از نوع FP16 برای Intel را همراه با توسعه‌های بعدی در tiling و شکل داده افزوده است. الگوریتم online softmax جای مسیر قبلی Softmax و Attention بدون flash را گرفته و sessionهای compile-only می‌توانند بدون دستگاه، graph transformation انجام دهند. تنظیمات buffer cache، سقف قابل‌تنظیم dispatchهای معلق و گزینه robustness نیز در دسترس قرار گرفته‌اند. مجموعه این تغییرها WebGPU را از رابط مناسب دمو به سمت محیطی قابل‌تنظیم و آزمون برای بهره‌بردار می‌برد؛ اما تفاوت مرورگر، driver، حافظه، گرما و سازنده را حذف نمی‌کند و مایکروسافت بنچمارک مشترکی منتشر نکرده که ادعای عمومی سرعت یا کاهش هزینه را توجیه کند.

شواهد یک محدودیت دیگر هم دارند که باید صریح گفته شود: GitHub ثبت کرده که متن یادداشت انتشار با کمک AI تهیه شده است. تغییرات کد، انتشار امضاشده و ارجاع به درخواست‌های ادغام، فهرست فنی را قابل ممیزی می‌کنند؛ اما نثر، اعتبارسنجی مستقل نیست. پیش از استقرار تولید، تیم باید موفقیت بارگذاری مدل، latency نخستین توکن، توان عملیاتی پایدار، اوج حافظه، برابری خروجی، توان مصرفی و رفتار هنگام شکست را روی ماتریس واقعی مرورگر، سیستم‌عامل و GPU خود بازتولید کند. فهرست قابلیت می‌تواند هزینه مورد انتظار یکپارچه‌سازی را پایین بیاورد؛ فقط اندازه‌گیری نشان می‌دهد هزینه هر وظیفه صحیح کامل واقعاً کم شده است یا نه.

عرضه سهام علی‌بابا سوی دیگر پشته AI را به‌طور کم‌سابقه‌ای شفاف می‌کند. اطلاعیه هنگ‌کنگ مورخ ۲۴ اوت می‌گوید شرکت برای عرضه ۷۱۰ میلیون سهم جدید با قیمت هر سهم ۱۱۲٫۷۰ دلار هنگ‌کنگ توافق کرده است. عایدی ناخالص ۸۰٫۰ میلیارد و عایدی خالص پس از کارمزد و هزینه‌های برآوردی حدود ۷۹٫۷ میلیارد دلار هنگ‌کنگ پیش‌بینی شده است. علی‌بابا قصد دارد ۱۰۰ درصد عایدی خالص را صرف توانمندی‌های تمام‌پشته AI، از جمله توسعه و ارتقای زیرساخت، کند. سهم‌های عرضه‌شده حدود ۳٫۷۰ درصد تعداد سهام پیش از معامله و با فرض عرضه کامل و نبود تغییر دیگر، حدود ۳٫۵۷ درصد تعداد سهام افزایش‌یافته هستند.

این سرمایه رایگان نیست و اطلاعیه قیمت آن را عددی می‌کند. قیمت ۱۱۲٫۷۰ دلار هنگ‌کنگ حدود ۳٫۶ درصد کمتر از قیمت مرجع سهم و ۹٫۰ درصد کمتر از میانگین پنج جلسه‌ای ADS علی‌بابا در نیویورک پس از تبدیل ارز و تقسیم بر نسبت هشت‌به‌یک ADS بود. شرکت همچنین با دوره منع عرضه ۹۰روزه پس از closing، با استثناهای اعلام‌شده، موافقت کرده است. تکمیل برای ۲۶ اوت انتظار می‌رفت اما هنوز به مجوز پذیرش، اسناد و سایر شرایط بازار و تسویه وابسته بود؛ اطلاعیه هشدار می‌دهد عرضه ممکن است انجام شود یا نشود. بنابراین ZharfAI رقم ۷۹٫۷ میلیارد را عایدی خالص مورد انتظار از معامله‌ای قیمت‌گذاری‌شده اما در زمان cutoff تکمیل‌نشده می‌داند، نه پولی که از قبل خرج شده و نه تضمین بازده.

پیوند دو تحول اصلی عملیاتی است، نه علّی. ONNX Runtime می‌کوشد استنتاج را به لایه اجرایی قابل‌حمل‌تری روی دستگاه‌های بیشتر ببرد. علی‌بابا با جذب سرمایه، زیرساخت و مدل و کاربردهای AI را در پشته خود عمیق‌تر می‌کند. اولی می‌تواند دامنه دستگاه و برخی موانع حافظه یا یکپارچه‌سازی را سبک‌تر کند؛ دومی نشان می‌دهد مالک پلتفرم برای عرضه مدل، محاسبه و کاربرد چه میزان سرمایه حاضر است بسیج کند. توزیع در لبه می‌تواند سبک‌تر شود، درحالی‌که آموزش، سرویس‌دهی، شبکه و ظرفیت مرکز داده در بالادست سنگین می‌ماند. پرسش مالی این است که آیا تقاضای مفید و حاشیه سود حفظ‌شده سریع‌تر از dilution، استهلاک و هزینه عملیاتی رشد می‌کنند یا نه.

دو قرائت رسمی تازه از تقاضا، فرض پذیرش بی‌دردسر را زیر سؤال می‌برند. Stats NZ گزارش کرد حجم خرده‌فروشی تعدیل‌شده فصلی در سه‌ماهه ژوئن نسبت به مارس، ۱۳۸ میلیون دلار نیوزیلند یا ۰٫۵ درصد کاهش یافت و هشت صنعت از ۱۵ صنعت افت کردند. حجم فروش سوخت ۱۳ درصد، خودرو و قطعات ۲٫۳ درصد، اقامت ۸٫۰ درصد و خدمات غذا و نوشیدنی ۲٫۸ درصد پایین آمد. استثنای برجسته، کالاهای برقی و الکترونیکی با رشد ۹٫۲ درصد بود. حجم‌ها اثر تورم قیمت و فصل را حذف می‌کنند، اما ارزش فروش منطقه‌ای فقط از نظر فصلی تعدیل شده است. رشد الکترونیک می‌تواند با هزینه‌کرد گزینشی فناوری سازگار باشد، ولی گزارش نوع خرید AI را مشخص نمی‌کند و برای ادعای علّی کافی نیست.

انتشار ۲۴ اوت فدرال‌رزرو شیکاگو نیز برای فعالیت آمریکا نشانه‌ای محتاطانه دارد. شاخص ملی فعالیت از مثبت ۰٫۰۶ در ژوئن به منفی ۰٫۰۸ در ژوئیه رسید و میانگین سه‌ماهه از مثبت ۰٫۰۱ به منفی ۰٫۰۴ کاهش یافت. از ۸۵ مؤلفه، ۴۰ مؤلفه سهم مثبت و ۴۵ مؤلفه سهم منفی داشتند؛ ۳۷ مورد بهتر و ۴۸ مورد بدتر شدند. مصرف شخصی و مسکن سهم منفی ۰٫۰۹ داشت و اثر مثبت کوچک تولید و نیز فروش، سفارش و موجودی را خنثی کرد. مقدار زیر صفر با رشد پایین‌تر از روند تاریخی سازگار است، اما یک مشاهده ماهانه پرنوسان و قابل بازبینی است و علامت رکود محسوب نمی‌شود. این یک شرط مرزی برای برنامه کسب‌وکار است، نه سیگنال سرمایه‌گذاری.

برای بهره‌بردار، آزمون مشترک دشوارتر از این پرسش است که «مدل اجرا می‌شود؟». استقرار WebGPU باید در سطح گردش‌کار کامل با استنتاج سرور مقایسه شود: تأخیر بار نخست، کیفیت خروجی پذیرفته‌شده، پوشش دستگاه، نرخ retry و fallback، مزیت حریم خصوصی، هزینه پشتیبانی و انرژی هر نتیجه مفید. برای تأمین‌کننده سرمایه، آزمون این است که مخارج زیرساخت پس از dilution سهام و استهلاک دارایی، بهره‌برداری پایدار و بازده نقدی می‌سازد یا نه. تقاضای گزینشی الکترونیک در نیوزیلند و ضعف فعالیت عمومی آمریکا سرمایه‌گذاری AI را باطل نمی‌کنند؛ اما ارزش ظرفیت مرحله‌بندی‌شده، اقتصاد واحد قابل مشاهده و محصولی را بالا می‌برند که مسئله‌ای پرهزینه را حل کند، نه فقط مسیر اجرایی جدیدی نشان دهد.

موارد بعدی برای رصد مشخص‌اند. درباره ONNX Runtime باید منتظر بنچمارک قابل بازتولید PagedAttention و کش کوانتیزه روی GPUهای Intel، AMD، NVIDIA و مجتمع، نتیجه سازگاری مرورگرها، آزمون برابری خروجی و شواهدی بود که نشان دهد deferred dispatch شروع سرد را بدون انتقال شکست به بخش دیگر بهتر می‌کند. درباره علی‌بابا ابتدا باید تکمیل در ۲۶ اوت تأیید شود، سپس مصرف واقعی عایدی، ظرفیت زیرساخت AI، استهلاک، بهره‌برداری ابر، حاشیه سود و جبران افزایش تعداد سهم با رشد درآمد رصد شود. در سوی تقاضا نیز پایداری رشد الکترونیک نیوزیلند و برگشت فشار مصرف و مسکن در شاخص شیکاگو اهمیت دارد. نتیجه قابل دفاع امروز محدودتر از روایت رونق AI است: لبه در حال بازشدن است، اما صورتحساب پشته و بار کسب بازده روی آن آشکارتر می‌شود.


منابع و اسناد

  1. 01ONNX Runtime WebGPU Plugin EP v0.3.0Microsoft ONNX Runtime · ۳ شهریور ۱۴۰۵
  2. 02Alibaba Group Announced Pricing of HK$80 Billion Placing of New Shares in Hong KongAlibaba Group · ۱ شهریور ۱۴۰۵
  3. 03Pricing of HK$80 Billion Placing of New Shares Under General MandateAlibaba Group HKEX Filing · ۱ شهریور ۱۴۰۵
  4. 04Retail Activity Falls by 0.5 Percent in the June 2026 QuarterStats NZ · ۲ شهریور ۱۴۰۵
  5. 05Index Suggests Economic Growth Decreased in JulyFederal Reserve Bank of Chicago · ۲ شهریور ۱۴۰۵

برچسب‌ها

چارچوب ONNX Runtimeفناوری WebGPUاستنتاج هوش مصنوعیعلی‌بابازیرساخت AIتأمین مالی سهامتقاضای خرده‌فروشیفدرال‌رزرو شیکاگو

اخبار مرتبط

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد
۲۹ شهریور ۱۴۰۵منبع: ggml-org

لاما سی‌پلاس‌پلاس با ادغام محاسبات، بعضی آزمون‌های مک را سریع‌تر کرد

توسعه‌دهندگان لاما سی‌پلاس‌پلاس در ۱۹ سپتامبر مجموعه‌ای از تغییرات اجرای مدل روی پردازنده‌های گرافیکی اپل را به کد اصلی افزودند. در آزمون گزارش‌شده برای یک مدل، سرعت تولید متن روی M2 Ultra حدود ۱۶ درصد بالا رفت؛ اما ادغامی دیگر پس از کاهش سرعت کنار گذاشته شد. پیام این تغییر، سودمند بودن ادغام‌های مشخص است، نه سریع‌تر شدن همه مدل‌ها یا اثبات کاهش هزینه. اصلاح جداگانه‌ای در مسیر کودا نیز به خطای حافظه پرداخت. در بخش اقتصاد، تولید صنعتی آمریکا در اوت ثابت ماند و انتظار تورمی یک‌ساله مصرف‌کنندگان منطقه یورو کمی افزایش یافت. فرمان تازه ویرجینیا هم دسترسی برخی مراکز داده جدید به حمایت‌های ایالتی را محدود کرد.

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد
۲۸ شهریور ۱۴۰۵منبع: Accenture

اکسنچر برای استقرار ارزیابان ایمنی در آنتروپیک توافق کرد

اکسنچر و آنتروپیک برای استقرار تیم ارزیابی در داخل شرکت سازنده مدل توافق کردند؛ هرکدام انتظار دارند طی پنج سال دست‌کم یک میلیارد دلار برای ایمنی هوش مصنوعی سرمایه‌گذاری کنند. این برنامه، هزینه انجام‌شده یا تضمین ایمنی نیست. هم‌زمان، کالیفرنیا برای پیشنهادهای نظارت مستقل مهلت تعیین کرد و میشل بومن در بحث نظارت بانکی بر فاصله شناخت خطر و اقدام تأکید گذاشت. جدا از این تحولات، نرخ هدف جدید بانک ژاپن از ۲۴ سپتامبر اجرا می‌شود. تحلیل ژرف توضیح می‌دهد چرا دسترسی ارزیاب، اختیار تصمیم‌گیری و شواهد اقدام اصلاحی را باید جدا سنجید.

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند
۲۶ شهریور ۱۴۰۵منبع: NVIDIA

گوگل و انویدیا برای اتصال سریع‌تر مراکز داده، کاهش مصرف در اوج را پیشنهاد کردند

گوگل، انویدیا و امرالد ای‌آی ائتلافی ساخته‌اند که می‌خواهد مراکز داده در برابر تعهد کاهش برداشت برق در زمان فشار، زودتر به شبکه وصل شوند. این اعلام هنوز به معنی برق تحویل‌شده یا قاعده الزام‌آور نیست. ژرف بررسی می‌کند چنین وعده‌ای برای موعد تحویل خدمات هوش مصنوعی چه معنایی دارد و چرا کم‌کردن برداشت از شبکه، لزوماً مصرف کل انرژی را کم نمی‌کند. رأی ۴۱۷ به ۳ مجلس نمایندگان آمریکا درباره حمایت از مشترکان، بحث پرداخت هزینه زیرساخت را جلو برده است؛ افزایش یک‌چهارم واحد درصدی نرخ بهره فدرال رزرو نیز خبر مالی مستقلی است. تصمیم تنظیم‌گر، عملکرد اندازه‌گیری‌شده و مسئولیت روشن هزینه‌ها، معیارهای بعدی‌اند؛ نه صرف حمایت شرکت‌ها.

تحلیل مستقل ژرف بر پایه منابع اصلی تدوین شده است؛ برای بررسی جزئیات و زمینه کامل به پیوندهای بالا مراجعه کنید.

می‌خواهید هوش مصنوعی را در کسب‌وکار خود پیاده‌سازی کنید؟

با تیم ما تماس بگیرید و درباره راهکارهای هوش مصنوعی صحبت کنید.

تماس با ما