
توافق محاسبه و شبکه: برنامهریزی مسئولانه زیرساخت هوش مصنوعی
برنامهریزی زیرساخت هوش مصنوعی، تقاضای محاسبه را به برق، آب، ذخیرهسازی، شبکه، انعطاف بار و تابآوری محلی پیوند میدهد.
ادامه مطلبتیم ژرف ایآی

فرستادن همه درخواستها به بزرگترین مدل موجود، پیادهسازی سادهای دارد اما دفاع از آن دشوار است. طبقهبندی تیکت، استخراج سند طولانی، توضیح ایمنیبحرانی و وظیفه برنامهنویسی چندمرحلهای به توان، تأخیر، حریم خصوصی و هزینه یکسان نیاز ندارند. لایه مسیریابی مدل این تفاوت را به سیاست انتخاب صریح تبدیل میکند.
مسیریاب فقط classifier انتخاب «مدل ارزان» نیست. صفحه کنترلی است که تصمیم میگیرد از ابزار قطعی، مدل کوچک یا تخصصی، استقرار خصوصی، مدل عمومی قویتر، cascade یا فرایند انسانی استفاده شود. همچنین زمان امتناع، retry و fallback را تعیین میکند. ارزش زمانی ساخته میشود که هدف کیفیت و خدمت با کمترین هزینه مورد انتظار کل برآورده شود، نه زمانی که بیشترین ترافیک به ارزانترین endpoint برود.
برای درخواست، مدل نامزد و وضعیت جاری سامانه، مسیریاب میتواند کیفیت مورد انتظار، هزینه مستقیم، توزیع تأخیر، احتمال و هزینه شکست، مجازبودن سیاستی و ظرفیت جاری را برآورد کند.
تابع ساده چنین است:
مطلوبیت = ارزش کیفیت - هزینه استنتاج - جریمه تأخیر - هزینه مورد انتظار شکست
وزنها تصمیم محصولاند. توضیح پزشکی برای مشتری، جریمه سنگینی برای ادعای بدون شاهد دارد. کار metadata پسزمینه شاید چند دقیقه تأخیر را بپذیرد اما سقف هزینه واحد داشته باشد. تا زمانی که سازمان مصالحه درست را تعریف نکند، مدل نمیتواند آن را یاد بگیرد.
قیمت token فقط بخشی از هزینه است. هزینه تماس مسیریاب، retry، فراخوانی دوگانه cascade، ابزار، retrieval، خروجی بلند، review انسانی، رخداد و پاسخ غلط را وارد کنید. مدلی که کمی گرانتر اما خروجی کوتاه و قابل استفاده میدهد ممکن است در کل ارزانتر باشد.
سیاست ثابت وظیفه، tenant، زبان یا حساسیت معلوم را به pool مشخص وصل میکند. شفاف است و برای نسخه نخست مناسب.
قاعده و دروازه قابلیت مدل بدون context، modality، structured output، ابزار، محل داده یا قرارداد لازم را حذف میکند؛ سپس بهینهسازی آغاز میشود.
مسیریابی آموختهشده از ورودی پیشبینی میکند کدام مدل حد کیفیت را رد میکند. مقاله داوریشده RouteLLM در ICLR 2025 مسیریاب قوی/ضعیف را از preference data آموخت و در setup خود بیش از دو برابر کاهش هزینه بدون افت کیفیت اندازهگیریشده گزارش کرد. این شاهد پژوهشی در مدل و benchmark خاص است، نه وعده عمومی صرفهجویی.
Cascade با مدل ارزان شروع و وقتی verifier، confidence یا check شکست خورد به مدل قویتر میرود. وقتی شکست قابل تشخیص است مفید است، اما latency و احتمال پرداخت دو تماس را بالا میبرد.
مسیریابی portfolio یا batch گروهی از درخواستها را با قید ظرفیت و بودجه تخصیص میدهد. preprint مارس ۲۰۲۶ درباره مسیریابی مقاوم در سطح batch در benchmark خود و batch خصمانه بهبود گزارش میکند؛ چون هنوز preprint است، نتیجه را جهتنما بدانید.
مسیریابی انسانی درخواست استثنایی، پرپیامد یا مبهم را به فرد میدهد. معماری بالغ این راه را دارد و هر ورودی را به زور وارد مدل نمیکند.
سامانهای را فرض کنید که reset رمز، اختلاف صورتحساب، سؤال امنیتی سازمانی و شکایت آزاد فارسی و انگلیسی را میگیرد.
نخست لایه قطعی، وضعیت حساب احرازشده و سیاست را میآورد. classifier سبک، نوع، زبان، فوریت و حساسیت را میسنجد. وضعیت reset وارد workflow قطعی میشود. مدل کوچک پرونده عادی را در schema خلاصه میکند. اگر مدل تخصصی فارسی در ارزیابی بهتر است، استخراج فارسی به آن میرود. مدل قوی برای سؤال امنیتی پیچیده draft مینویسد، اما فقط از منبع مصوب. refund بالای حد به انسان میرود.
پیش از تحویل، پاسخ بررسی میشود: ارجاع لازم وجود دارد؟ واقعیت حساب با ابزار سازگار است؟ قید سیاست رعایت شده؟ وعده بدون اختیار ساخته نشده؟ اگر خروجی مدل کوچک fail شود، یک بار escalation مجاز است؛ شکست دوم به کارشناس میرود، نه حلقه بیپایان میان providerها.
trace باید ورودی سیاست، pool مجاز، مدل و نسخه انتخابی، prompt، ابزار، token، latency، check کیفیت، دلیل fallback و نتیجه کاربر را نگه دارد. این تفاوت routing با تعویض مبهم provider است.
برای هر استقرار کارت عملیاتی داشته باشید:
برای capability و قیمت، از سند جاری فروشنده استفاده کنید اما آن را شاهد فروشنده برچسب بزنید و عملیاتی verify کنید. ادعای provider درباره سرویس عرضهشده است، نه عملکرد روی توزیع شما. snapshot نسخهدار نگه دارید، چون نام، limit و قیمت عوض میشود.
در self-hosting، رزرو accelerator، ظرفیت بیکار، انرژی، مهندسی استقرار، observability، patch امنیت و on-call را حساب کنید. «قبض per-token ندارد» به معنی رایگان نیست.
برای extraction شاید exact match کافی باشد. پشتیبانی به انطباق سیاست، واقعیت، کاملبودن، لحن و resolution نیاز دارد. کد به test و review نیاز دارد. همه را در یک judge score عمومی ادغام نکنید.
نمونه واقعی، مجاز و بدون شناسه را در زبان، tenant، طول، پیچیدگی، حساسیت و edge case جمع کنید. holdout زمانی داشته باشید تا روی ترافیک بعدی آزمون شود. refusal و workflow قطعی را هم وارد کنید.
خروجی را با ابزار و قرارداد prompt یکسان بسازید. check قطعی، reviewer حوزه و model grader اعتبارسنجیشده را ترکیب کنید. نام provider و قیمت از reviewer انسانی پنهان باشد.
مسیریاب به برآورد کالیبره عبور از حد نیاز دارد. مقاله ۲۰۲۶ ACL Student Research Workshop درباره conformal LLM routing تلاش میکند برای نرخ نقض در درخواستهای فرستادهشده به مدل ارزان bound آماری بسازد. دامنه benchmark آن محدود است، اما جهت مهمی نشان میدهد: ریسک routing را به tolerance قابل سنجش تبدیل کنید.
انتخاب مسیریاب را ثبت کنید ولی production را تغییر ندهید. کیفیت، هزینه و latency counterfactual را با baseline بسنجید. سپس روی ترافیک کمریسک canary و kill switch اجرا کنید.
پیش از اعتماد به سیاست routing از چارچوب ارزیابی گسترده و بازتولیدپذیر استفاده کنید. چارچوب HELM مرکز CRFM استنفورد مدلها را در سناریو و معیارهای متعدد میسنجد و نتیجه خام را برای بررسی منتشر میکند. HELM چارچوب پژوهشی است، نه آزمون پذیرش production؛ ارزش آن در اینجا روش است. مسیریاب باید روی ترکیب واقعی وظایف، زبانها، سطح ریسک، قید latency و پیامد انسانی سازمان ارزیابی شود، نه یک امتیاز تجمیعی benchmark.
سوگیری judge: مدل grader ممکن است style خودش یا provider خاص را ترجیح دهد. با human review کور کالیبره کنید.
سوگیری انتخاب: ترافیک تاریخی قبلاً توسط سامانه قبلی فیلتر شده است. از تقاضای خام، رهاشده و escalated نمونه بگیرید.
میانگین آسان: حجم بالای کار آسان، شکست شدید slice کوچک را پنهان میکند. بر اساس وظیفه، زبان، مشتری، ریسک و پیچیدگی گزارش دهید.
شکاف counterfactual: در تولید فقط خروجی مسیر منتخب دیده میشود. در جای امن exploration تصادفی کوچک را حفظ کنید.
رانش مدل: update فروشنده میتواند کیفیت را بدون تغییر کد عوض کند. نسخه را در صورت امکان pin و تغییر را trigger ارزیابی کنید.
بازی کاربر: کاربر ممکن است wording را برای گرفتن مدل premium تغییر دهد. threshold ساده را آشکار نکنید و abuse را پایش کنید.
این لایه باید dataset و release discipline را با ارزیابی مدلهای مرزی و trace را با مشاهدهپذیری عامل به اشتراک بگذارد.
پیش از رسیدن ورودی به provider، مجازبودن route را تعیین کنید. طبقهبندی حساسیت را با metadata یا فرایند محلی قابل اعتماد انجام دهید؛ محتوا را برای پرسیدن اینکه کجا برود به مدل نامجاز نفرستید.
ایزوله tenant و منطقه، provider مصوب، قاعده نگهداشت، دفاع prompt injection، مجوز ابزار مستقل از مدل، review انسانی بر اساس پیامد، circuit breaker هزینه و fallback قطعی را اجرا کنید. اگر مدل premium ابزار بیشتری دارد، escalation نباید privilege escalation باشد. مسیریاب محاسبه را انتخاب میکند؛ authorization در application میماند.
فقط «درصد ترافیک روی مدل کوچک» را نبینید. نرخ عبور کیفیت و شکست وزندار، هزینه هر کار موفق، p50/p95/p99 تا نتیجه قابل استفاده، escalation و retry، double-pay، human review، reopen، calibration، تلاش نامجاز، تمرکز provider، هزینه tenant و drift زبان/وظیفه را اندازه بگیرید.
هزینه مدل را از طریق FinOps هوش مصنوعی به اقتصاد محصول وصل کنید. اگر inference ارزان شود اما تماس پشتیبانی یا churn بالا برود، بهینهسازی رخ نداده است.
پیش از launch:
۱. هر نامزد دروازه قابلیت، حریم خصوصی، امنیت و قرارداد را رد کند.
۲. کیفیت وظیفه در margin مصوب non-inferior باشد.
۳. شکست شدید هر slice زیر tolerance بماند.
۴. p95 latency در بودجه workflow باشد.
۵. محاسبه هزینه overhead مسیریاب، retry، ابزار و review را شامل شود.
۶. fallback حلقه محدود داشته و در outage آزموده شود.
۷. تصمیم route از شواهد نسخهدار بازسازی شود.
۸. kill switch ترافیک را به baseline امن برگرداند.
۹. محصول، مهندسی، امنیت، حریم خصوصی، مالی و ریسک تأیید کنند.
rollback میتواند سراسری، وظیفهای، tenant یا مدلمحور باشد. baseline پایدار حفظ کنید و در رخداد کشف نکنید که همه راهها به provider واحد وابستهاند.
وقتی حجم زیاد، دشواری متغیر، اختلاف معنیدار هزینه/latency و check کیفیت دارید، routing جذاب است. وقتی حجم کم، همه درخواستها پرپیامد، یک مدل در همه sliceها غالب یا overhead نزدیک صرفهجویی است، ارزش کمتر میشود.
با سیاست ثابت برای چند دسته معلوم آغاز کنید. cascade را وقتی failure ارزان تشخیص داده میشود اضافه کنید. learned router را فقط پس از outcome نماینده و ظرفیت ارزیابی پیوسته بسازید. پیچیدگی باید هزینه عملیاتی خود را توجیه کند.
خیر. classifier گران، cascade زیاد، retry یا خروجی بلند مدل ارزان میتواند صرفهجویی را حذف کند.
فقط پس از calibration. confidence خوداظهاری اغلب با correctness هماهنگ نیست و با prompt و نسخه عوض میشود.
تابآوری و رقابت قیمت بهتر میشود، اما سیاست، integration و consistency سختتر است. فقط provider مصوب و قرارداد نرمالشده.
پایش پیوسته و recalibration پس از تغییر ترافیک، مدل، قیمت، prompt یا سیاست؛ release کنترلشده، نه drift خودکار.
کار پرتکرار، کمپیامد و قابل امتیاز را در shadow از مدل بزرگ به مدل کوچک ارزیابیشده ببرید و یک fallback روشن بگذارید.
مسیریاب مدل، موتور سیاست مبتنی بر شواهد است. باید کمهزینهترین مسیر مجازی را که هدف کیفیت و تأخیر وظیفه را میگذراند انتخاب، دلیل را آشکار و هنگام عدمقطعیت امن fail کند. مزیت پایدار classifier هوشمند نیست؛ ارزیابی، authorization، observability و rollback پیرامون انتخاب است.
منابع بررسیشده و جاری تا ۳۰ ژوئیه ۲۰۲۶:

برنامهریزی زیرساخت هوش مصنوعی، تقاضای محاسبه را به برق، آب، ذخیرهسازی، شبکه، انعطاف بار و تابآوری محلی پیوند میدهد.
ادامه مطلب
نگاه عملیاتی به هوش مصنوعی در بانکداری ایران: کشف تقلب، اعتبارسنجی، دستیار مشتری فارسی و اتوماسیون اسناد، همراه با الزامات حاکمیتی و مسیر پایلوت کمریسک برای شروع.
ادامه مطلب
چکلیستی مبتنی بر شواهد برای انتخاب شرکت هوش مصنوعی در ایران: تعریف مسئله، ارزیابی فارسی، امنیت داده، پایلوت قابلاندازهگیری و قرارداد خروج.
ادامه مطلبگزارش روزانه و راهنماهای عملیاتی ژرف را ببینید. این صفحه یک آرشیو موضوعی است، نه دعوت به شروع پروژه.