فناوری هوش مصنوعی

API هوش مصنوعی در ایران: راهنمای بی‌طرف برای شرکت‌ها و توسعه‌دهندگان

راهنمای بی‌طرف دسترسی قانونی به API هوش مصنوعی در ایران: سرویس‌های داخلی، درگاه‌های واسط، میزبانی مدل باز، سنجش کیفیت فارسی، روش محاسبه هزینه و کدی با مسیر جایگزین.

API هوش مصنوعی در ایران: راهنمای بی‌طرف برای شرکت‌ها و توسعه‌دهندگان
نویسنده
تیم ژرف
انتشار
۲ مهر ۱۴۰۵
زمان مطالعه
۱۹ دقیقه

هر شرکت ایرانی که بخواهد مدل زبانی بزرگ را وارد محصول، پشتیبانی مشتری یا گردش اسناد خود کند، دیر یا زود به یک پرسش عملی می‌رسد: از همین‌جا به کدام API هوش مصنوعی می‌توان وصل شد، بی‌آنکه کسب‌وکار روی چیزی بنا شود که هر لحظه ممکن است خاموش شود؟ پاسخ کوتاه این است که یک تأمین‌کننده امن و همیشگی وجود ندارد. چند مسیر مشروع وجود دارد: سرویس داخلی API هوش مصنوعی، مدل باز روی سرور خودتان، و در موارد محدود سکوی خارجی که شرایط استفاده‌اش واقعاً کاربرد شما را مجاز می‌داند. معماری پایدار همه این مسیرها را پشت یک رابط واحد می‌گذارد که در اختیار تیم خودتان است.

این راهنما برای مدیران فنی، معماران نرم‌افزار و توسعه‌دهندگانی نوشته شده است که باید این تصمیم را با شاهد بگیرند. توضیح می‌دهیم چرا APIهای خارجی آشنا از ایران به‌سختی قابل استفاده‌اند، گزینه‌های داخلی و میزبانی شخصی بر پایه مستندات خودشان دقیقاً چه می‌دهند، سخت‌افزار را چگونه برآورد کنیم، هزینه را بدون اعتماد به قیمت تبلیغاتی چطور مقایسه کنیم، کیفیت فارسی را چگونه بیازماییم و کدی بنویسیم که ارائه‌دهنده را فقط با تغییر پیکربندی عوض کند.

یک مرز را آگاهانه نگه می‌داریم: این متن هیچ روشی برای دورزدن تحریم، مسدودسازی جغرافیایی، احراز هویت یا شرایط استفاده ارائه‌دهندگان آموزش نمی‌دهد و فروشندگان واسطه حساب را هم معرفی نمی‌کند. چنین میان‌برهایی داده، حساب و تداوم کار شما را به توافقی می‌سپارند که بی‌خبر پایان می‌یابد. همه آنچه در ادامه می‌آید گزینه‌هایی است که می‌توان در برابر هیئت‌مدیره، حسابرس و مشتری از آن دفاع کرد.

چرا استفاده از API مدل‌های خارجی از ایران دشوار است

چهار مانع جدا روی هم جمع می‌شوند و هرکدام به شکل متفاوتی کار را متوقف می‌کنند.

سیاست ارائه‌دهنده. ارائه‌دهندگان اصلی مدل، فهرست کشورهای تحت پوشش خود را منتشر می‌کنند و ایران در هیچ‌کدام نیست. صفحه کشورهای پشتیبانی‌شده OpenAI ایران را فهرست نمی‌کند و هشدار می‌دهد که دسترسی یا «فراهم‌کردن دسترسی» به خدماتش بیرون از این فهرست ممکن است به مسدود یا تعلیق‌شدن حساب بینجامد. عبارت فراهم‌کردن دسترسی مهم است، چون واسطه‌ها را هم در بر می‌گیرد و فقط کاربر نهایی را نه. صفحه مناطق پشتیبانی‌شده Anthropic نیز ایران را ندارد و حق خودداری از خدمت‌رسانی به نهادهایی را که مالکیت اکثریتشان به کشورهای بیرون از فهرست برمی‌گردد برای خود محفوظ می‌داند. گوگل هم در صفحه مناطق دردسترس Gemini API که آخرین بار در اردیبهشت ۱۴۰۵ به‌روز شده، ایران را فهرست نکرده است.

قانون تحریم. پشت این فهرست‌ها، برنامه تحریم‌های ایران قرار دارد که دفتر کنترل دارایی‌های خارجی وزارت خزانه‌داری آمریکا (OFAC) آن را اداره می‌کند و مقررات تحریم‌ها و معاملات ایران بخشی از آن است. صفحه برنامه تحریم‌های ایران در OFAC نشان می‌دهد این برنامه فعال است و حتی در شهریور ۱۴۰۵ نیز نام‌گذاری‌های تازه داشته است. OFAC برای برخی ابزارهای ارتباطات شخصی مجوز عمومی صادر کرده است، اما اینکه کاربرد تجاری مشخصی از یک API زیر چنین مجوزی قرار بگیرد یا نه، پرسشی برای مشاور حقوقی واجد صلاحیت است. در عمل خود ارائه‌دهندگان ایران را کشور پشتیبانی‌نشده اعلام کرده‌اند. همین چارچوب صادرات کالای آمریکایی را هم محدود می‌کند و این نکته هنگام خرید پردازنده گرافیکی دوباره اهمیت پیدا می‌کند.

پرداخت و احراز هویت. سکوهای خارجی از راه کارت و شبکه بانکی بین‌المللی صورت‌حساب می‌فرستند و حساب را با کشورهای پشتیبانی‌شده تطبیق می‌دهند. کارت و حساب صادرشده در ایران معمولاً نمی‌تواند این چرخه را کامل کند و بازار خاکستری واسطه‌ها دقیقاً از همین‌جا شکل گرفته است؛ همان وابستگی‌ای که این راهنما از آن پرهیز می‌دهد.

خود شبکه. اتصال بین‌المللی از ایران تضمین‌شده نیست. گزارش اختلال‌های سه‌ماهه نخست ۲۰۲۶ کلادفلر قطعی سراسری‌ای را ثبت کرده که از ۱۸ دی ۱۴۰۴ (۸ ژانویه ۲۰۲۶) آغاز شد، ترافیک تا ۱ بهمن تقریباً صفر ماند و بازگشت کامل‌تر از ۷ بهمن شروع شد. قطعی دوم از ۹ اسفند ۱۴۰۴ (۲۸ فوریه) آغاز شد و دسترسی در آن با «فهرست سفید» و «سیم‌کارت سفید» محدود شد. گزارش پیگیری کلادفلر در خرداد ۱۴۰۵ از بازگشت فقط بخشی از اتصال در ۵ خرداد خبر می‌دهد؛ یعنی ۸۷ روز پس از آغاز قطعی دوم. در آن هفته‌ها هر گردش‌کاری که به مدل میزبانی‌شده در خارج وابسته بود، به‌سادگی متوقف شد. به همین دلیل جست‌وجوی «api هوش مصنوعی نت ملی» یک نیاز عملیاتی است، نه کنجکاوی.

چهار مسیر برای رسیدن به مدل از راه API

پیش از مقایسه برندها، مسیرها را مقایسه کنید. مهم‌ترین پرسش این است که مدل از نظر فیزیکی کجا اجرا می‌شود، چون همین یک واقعیت اقامت داده، تداوم خدمت و ریسک حقوقی را تعیین می‌کند.

مسیرمحل اجرای مدلدر قطع اتصال بین‌المللی کار می‌کند؟ریسک شرایط استفاده و تحریمشکل هزینه
ارائه‌دهنده خارجی، مستقیممراکز داده ارائه‌دهنده در خارجخیرایران بیرون از فهرست ارائه‌دهندگان اصلی استبه‌ازای توکن، با ارز خارجی
درگاه واسط یا مسیریاب خارجیدر خارج، روی هر ارائه‌دهنده‌ای که درگاه انتخاب کندخیرشرایط خود درگاه به‌علاوه محدودیت‌های هر ارائه‌دهنده بالادستبه‌ازای توکن، با ارز خارجی
سرویس داخلی API هوش مصنوعیدر ایران برای مدل‌های میزبانی‌شده روی سرور خود ارائه‌دهنده؛ در خارج برای مدل‌های خارجیِ بازارسال‌شدهفقط برای مدل‌هایی که واقعاً در ایران اجرا می‌شوندمدل خارجیِ بازارسال‌شده همچنان تابع شرایط بالادست استریالی؛ بپرسید قیمت توکن به چه چیزی گره خورده است
مدل باز روی سرور خودتانسرور سازمان یا ماشین اجاره‌ای در ابر داخلیبله، اگر سرور و کاربران در یک سوی شبکه باشندمجوز انتشار مدل و قانونی‌بودن مسیر تأمین سخت‌افزارعمدتاً ثابت: سخت‌افزار، برق و نیروی فنی

بیشتر سازمان‌ها به ترکیبی می‌رسند: مسیر داخلی یا میزبانی شخصی برای هر کار حساس یا حیاتی، و فرایند استثنای محدود و مکتوب برای بقیه. راهنمای انتخاب میان ابزار بومی و خارجی هوش مصنوعی این لایه‌بندی را از نگاه کسب‌وکار بررسی کرده است؛ این مقاله به سازوکار فنی اتصال از راه API می‌پردازد.

API هوش مصنوعی داخلی: مستندات را بخوانید، نه تبلیغ را

جست‌وجوهایی مانند «خرید API هوش مصنوعی» و «api هوش مصنوعی ایرانی» به‌سرعت به شرکت‌های ابری داخلی می‌رسند که دسترسی به هوش مصنوعی را از راه یک API واحد می‌فروشند. آروان‌کلاد و لیارا دو نمونه‌اند که برای این سرویس مستندات عمومی منتشر کرده‌اند. ترتیب آمدن نامشان رتبه‌بندی نیست و توصیف زیر فقط از مستندات خودشان برداشته شده است.

مستندات سرویس هوش مصنوعی آروان‌کلاد از نقطه دسترسی خصوصی برای هر مدل با کلیدی که خود مشتری می‌سازد، گزارش مصرف توکن همراه با هزینه، و محدودیت نرخ درخواست در ثانیه یا دقیقه برای هر نقطه دسترسی سخن می‌گوید. همین صفحه می‌گوید برخی مدل‌ها مستقیماً روی زیرساخت خود آروان میزبانی می‌شوند، قابلیت پایگاه دانش برای پاسخ‌گویی از داده‌های خود مشتری دارد، فعلاً امکان تنظیم دقیق یا آموزش مدل وجود ندارد و تاریخچه گفت‌وگو میان درخواست‌ها ذخیره نمی‌شود.

مستندات سرویس هوش مصنوعی لیارا سرویسی را توصیف می‌کند که فهرست مدل‌هایش هم خانواده‌های بسته خارجی مانند GPT از OpenAI، Gemini از گوگل، Claude از Anthropic و Grok را در بر می‌گیرد و هم خانواده‌های باز مانند Llama، Mistral و Qwen را. صفحه معرفی این سرویس نمی‌گوید هر مدل کجا پردازش می‌شود و کدام مدل، اگر مدلی باشد، روی سرورهای داخل ایران اجرا می‌شود.

نکته اصلی همین خلأ است. وقتی یک سرویس داخلی GPT، Claude یا Gemini را عرضه می‌کند، درخواست به مدلی خارجی بازارسال می‌شود: متن شما از کشور خارج می‌شود، سیاست کشوری و شرایط ارائه‌دهنده بالادست همچنان بر آن ترافیک حاکم است و با قطع اتصال بین‌المللی، این مسیر هم قطع می‌شود. مدل بازی که روی سرورهای خود ارائه‌دهنده در ایران اجرا می‌شود، محصولی واقعاً متفاوت با ویژگی‌های متفاوت است. پیش از هر خرید، از هر ارائه‌دهنده برای هر مدل پاسخ مکتوب این چهار پرسش را بخواهید: اجرای مدل کجاست، چه چیزی و تا چه مدت در لاگ می‌ماند، کدام طرف سوم داده را دریافت می‌کند، و کدام مدل‌ها در قطعی‌های ۱۴۰۴ و ۱۴۰۵ در دسترس ماندند.

OpenRouter (اوپن روتر) و مسیریاب‌ها: چه چیزی تغییر می‌کند و چه چیزی نه

توجه توسعه‌دهندگان ایرانی به OpenRouter و ابزارهای مسیریابی محلی در سال ۱۴۰۵ آشکارا بیشتر شده است؛ پس بهتر است دقیق بدانیم این ابزارها چه هستند و چه کاری از آن‌ها برنمی‌آید.

OpenRouter یک API یکپارچه در برابر صدها مدل از ارائه‌دهندگان گوناگون است و نشانی پایه‌ای سازگار با قالب OpenAI دارد. مستندات مسیریابی ارائه‌دهنده در OpenRouter توضیح می‌دهد که به‌طور پیش‌فرض ارائه‌دهندگانی را ترجیح می‌دهد که اخیراً قطعی نداشته‌اند، از میان ارائه‌دهندگان پایدار قیمت پایین‌تر را وزن بیشتری می‌دهد، هنگام خطای یک ارائه‌دهنده سراغ بعدی می‌رود و با گزینه‌ای مانند zdr می‌توان درخواست‌ها را فقط به نقاطی فرستاد که سیاست عدم نگهداری داده دارند. این‌ها ایده‌های مهندسی ارزشمندی‌اند.

شرایط استفاده OpenRouter که آخرین بار در ۹ شهریور ۱۴۰۵ (۳۱ اوت ۲۰۲۶) به‌روز شده، به همان اندازه مهم است. طرف این شرایط شرکت OpenRouter, Inc. در نیویورک است و بنابراین خودش مشمول همان برنامه تحریم آمریکاست. متن شرایط می‌گوید برخی ارائه‌دهندگان مدل به کاربرانی که در کشورها یا مناطق معینی هستند اجازه دسترسی نمی‌دهند، این «مدل‌های محدودشده» را نمی‌توان از راه این سرویس به کار گرفت و استفاده از سرویس برای فروش مجدد دسترسی API ممنوع است. درگاه واسط محدودیت‌های بالادست را از بین نمی‌برد؛ همه آن‌ها را به ارث می‌برد و محدودیت‌های خودش را هم می‌افزاید. برای شرکت ایرانی این یک ریسک حقوقی و تداومی است که باید با مشاور حقوقی سنجیده شود، نه راه‌حل.

مسیریاب‌های محلی دسته دیگری‌اند. ابزارهایی که توسعه‌دهندگان ایرانی با نامشان جست‌وجو می‌کنند، مانند 9router یا claude-code-router، روی رایانه خودتان به‌عنوان پراکسی محلیِ سازگار با OpenAI اجرا می‌شوند، قالب‌های مختلف API را به هم ترجمه می‌کنند و میان مقصدهای بالادستی که تعریف کرده‌اید جابه‌جا می‌شوند. این ابزارها لوله‌کشی را عوض می‌کنند، نه حقوق را: هر درخواست همچنان به حساب مشروع در بالادست نیاز دارد. برخی از آن‌ها چرخاندن چند حساب یا روی‌هم‌گذاشتن سهمیه‌های رایگان را برای فرار از محدودیت تبلیغ می‌کنند و این دقیقاً همان رفتاری است که بیشتر شرایط استفاده ممنوع کرده‌اند. هیچ شرکتی نباید بار تولیدی خود را روی این الگو بنا کند.

میزبانی مدل باز با Ollama (اولاما)، vLLM یا llama.cpp

اجرای مدل باز روی سرور خودتان تنها مسیری است که کل راه، از ورودی تا پاسخ، در کنترل شماست. سه سرور متن‌باز پخته، رابطی سازگار با قالب OpenAI ارائه می‌کنند؛ یعنی کد برنامه هنگام جابه‌جایی میان آن‌ها، یا ترک همه‌شان، لازم نیست تغییر کند.

  • Ollama (اولاما) سریع‌ترین شروع روی یک ماشین است. مستندات سازگاری Ollama با OpenAI نشانی پایه http://localhost:11434/v1/ را به کار می‌برد، کلیدی می‌خواهد که کتابخانه لازم دارد اما سرور نادیده‌اش می‌گیرد، و از تکمیل گفت‌وگو، تکمیل متن، ساخت بردار تعبیه، فهرست مدل‌ها و بخش بی‌حالت Responses API پشتیبانی می‌کند. کمبودهایش را هم نوشته است، مانند نبود tool_choice و احتمال لگاریتمی.
  • vLLM برای توان پردازشی بالا روی سرورهای گرافیکی ساخته شده است. مستندات سرور سازگار vLLM سرور را با vllm serve و نام مدل و در صورت نیاز --api-key راه می‌اندازد و برنامه‌ها به http://localhost:8000/v1 وصل می‌شوند.
  • llama.cpp مدل‌های کوانتیزه با قالب GGUF را روی سخت‌افزار معمولی، حتی پردازنده مرکزی، کارآمد اجرا می‌کند. مستندات llama-server نقاط سازگار /v1/chat/completions و /v1/completions را به‌طور پیش‌فرض روی درگاه ۸۰۸۰ توصیف می‌کند.

در میان مدل‌های باز، کار متمرکز بر فارسی هم هست. کارت مدل Dorna2 از شرکت پارت مدلی هشت‌میلیارد پارامتری بر پایه Llama 3.1 را توصیف می‌کند که برای فارسی تطبیق داده شده، با مجوز Llama 3.1 منتشر شده و میانگین ۵۰٫۷۲ درصد در پنج آزمون فارسی را در برابر ۵۰٫۱۴ درصد مدل پایه گزارش می‌کند. این فاصله کوچک رقم اعلامی خود توسعه‌دهنده است و یادآوری خوبی است که برچسب فارسی فرضیه‌ای برای آزمودن است، نه نتیجه. اداره مدل باز در محیط تولید، از نسخه‌گذاری و وصله امنیتی تا ارزیابی و بازگشت، در راهنمای عملیات مدل‌های باز آمده است.

برآورد سخت‌افزار برای مدل روی سرور خودتان

برآورد اولیه ساده است. راهنمای Hugging Face درباره بهینه‌سازی سرعت و حافظه مدل‌های زبانی قاعده سرانگشتی می‌دهد: بارگذاری مدلی با X میلیارد پارامتر در دقت bfloat16 یا float16 حدود ۲ × X گیگابایت و در float32 حدود ۴ × X گیگابایت حافظه پردازنده گرافیکی می‌خواهد. در مثال همان راهنما، یک مدل برنامه‌نویسی ۱۵٫۵ میلیارد پارامتری در bfloat16 حدود ۲۹ گیگابایت، با کوانتیزه‌سازی هشت‌بیتی حدود ۱۵ گیگابایت و با کوانتیزه‌سازی چهاربیتی حدود ۹٫۵ گیگابایت مصرف کرد؛ با اندکی کندی و این هشدار که کوانتیزه‌سازی می‌تواند خروجی را تغییر دهد.

وزن‌های مدل فقط آغاز ماجراست. حافظه نهان کلید-مقدار با طول متن ورودی و شمار کاربران هم‌زمان بزرگ می‌شود؛ در همان راهنما، این حافظه برای همان مدل در ۱۶ هزار توکن به‌تنهایی حدود ۱۵ گیگابایت لازم داشت، پیش از صرفه‌جویی‌های معماری مانند توجه پرسش‌گروهی (GQA). برای طول واقعی ورودی، شمار درخواست‌های هم‌زمان و حاشیه اطمینان برآورد کنید و سپس روی خود سرور اندازه بگیرید.

دو واقعیت محلی هم باید در برنامه باشد. نخست، چارچوب تحریمی که صادرات کالای آمریکایی را محدود می‌کند سخت‌افزار مرکز داده را هم در بر می‌گیرد؛ پس تأمین پردازنده گرافیکی باید در همان بازبینی حقوقیِ نرم‌افزار بررسی شود. دوم، ابرهای داخلی ماشین گرافیکی اجاره می‌دهند و می‌توان پیش از هر خرید، مدل را در مقیاس واقعی آزمود؛ در این صورت همان پرسش‌های اقامت داده و لاگ را که از ارائه‌دهنده API می‌پرسید، از ارائه‌دهنده ابر هم بپرسید.

اقامت داده و حریم خصوصی برای سازمان‌های ایرانی

«میزبانی در ایران» نقطه شروع است، نه کنترل. نخست داده‌ای را که وارد درخواست‌ها می‌شود طبقه‌بندی کنید: پرونده مشتری، قرارداد، صورت مالی یا اطلاعات سلامت. سپس هر جایی را که درخواست از آن می‌گذرد نقشه‌برداری کنید: سرور برنامه، درگاه، سرور مدل، لاگ، حافظه نهان، ابزار پایش و نسخه پشتیبان. مقاله اثبات اقامت داده‌های هوش مصنوعی توضیح می‌دهد چرا برچسب منطقه در کنسول ابری ثابت نمی‌کند پردازش واقعاً کجا انجام شده است.

برای هر مسیر پاسخ مکتوب درباره مدت نگهداری، استفاده برای آموزش، پردازشگرهای فرعی، حذف و دسترسی کارکنان بگیرید. صلاحیت هر مسیر را پیش از رسیدن درخواست به مدل تعیین کنید: محتوای حساس نباید فقط برای فهمیدن اینکه به کجا تعلق دارد، به مسیری فرستاده شود که مجاز نیست. الزام‌های ناشی از نهاد ناظر بخشی، قراردادها و سیاست داخلی در هر سازمان فرق می‌کند؛ آن‌ها را با مشاور حقوقی واجد صلاحیت بررسی کنید، نه از روی صفحه تبلیغاتی فروشنده.

API هوش مصنوعی ارزان: مقایسه هزینه بدون قیمت ساختگی

«api هوش مصنوعی ارزان» فقط وقتی ارزان است که کار را تمام کند. مسیرها را بر پایه هزینه هر کار موفق مقایسه کنید و این هزینه را از متغیرهایی بسازید که روی ترافیک خودتان اندازه می‌گیرید:

  • میانگین توکن ورودی و خروجی هر کار، با توکن‌ساز هر ارائه‌دهنده و روی اسناد فارسی خودتان؛
  • قیمت توکن و مبنای تعیین آن، به‌ویژه اینکه آیا قیمت ریالی از تعرفه ارزی پیروی می‌کند؛
  • نرخ تکرار درخواست، رفتن به مسیر جایگزین و شکست اعتبارسنجی خروجی؛
  • نرخ برخورد حافظه نهان برای پرسش‌های تکراری؛
  • دقیقه‌های بازبینی انسانی هر کار و هزینه خطایی که از بازبینی عبور می‌کند.

فارسی اندازه‌گیری جداگانه می‌خواهد. پژوهش بی‌عدالتی توکن‌سازها میان زبان‌ها که در کنفرانس NeurIPS 2023 ارائه شد، نشان داد یک متن واحد پس از ترجمه به زبان‌های مختلف ممکن است تا ۱۵ برابر تفاوت طول توکنی داشته باشد و این مستقیماً بر هزینه، تأخیر و حجم متنی که در پنجره مدل جا می‌شود اثر می‌گذارد. ضریب ثابتی برای فارسی فرض نکنید؛ نسبت توکن به نویسه را روی پیکره خودتان بشمارید.

میزبانی شخصی شکل دیگری دارد: خرید یا اجاره سخت‌افزار، برق، سرمایش، مهندسی که پشته را به‌روز نگه می‌دارد، آماده‌باش خارج از ساعت کاری و ظرفیت بلااستفاده. این هزینه ثابت ماهانه را بر شمار کارهای موفقی که واقعاً اجرا می‌کنید تقسیم کنید. در حجم کم، API به‌ازای توکن معمولاً برنده است؛ در حجم بالا و پایدار، یا وقتی تداوم خدمت خودش قیمت دارد، میزبانی شخصی می‌تواند برنده شود. تنها مقایسه صادقانه همانی است که با اعداد خودتان حساب شده باشد.

پایداری: یک رابط، مسیر جایگزین آزموده، حافظه نهان محتاط

ارزشمندترین تصمیم طراحی، رابطی داخلی است که برنامه به‌جای تماس مستقیم با فروشنده آن را صدا می‌زند. پشت این رابط، فهرستی مرتب از مسیرهای مجاز نگه دارید که هرکدام نشانی پایه، کلید، نام مدل، مهلت پاسخ و سابقه کیفیت خود را دارد. وقتی مسیر اصلی با پایان مهلت، محدودیت نرخ یا خطای سرور شکست می‌خورد، رابط سراغ مسیر مجاز بعدی می‌رود و ثبت می‌کند کدام مسیر پاسخ داد.

مسیر جایگزین رایگان نیست. مدل محلی کوچک‌تر ممکن است برای دسته‌بندی کافی باشد و برای پاسخ مستقیم به مشتری نه؛ پس از پیش تعریف کنید سامانه در حالت کاهش‌یافته هنوز اجازه چه کاری دارد. راهنمای اینکه سامانه پس از ازکارافتادن مدل اصلی چه اختیاری دارد این قرارداد را شرح می‌دهد. انتخاب میان مسیرها بر پایه هزینه و کیفیت، و نه فقط دردسترس‌بودن، موضوع مقاله لایه مسیریابی مدل است. حافظه نهان پاسخ‌های تکراری هم هزینه را کم می‌کند و هم وابستگی به هر مسیر را، اما پاسخ ذخیره‌شده ممکن است خطا را تکرار کند یا میان کاربران نشت کند؛ مقاله بازاستفاده امن از پاسخ هوش مصنوعی حفاظ‌های لازم را توضیح می‌دهد.

کل زنجیره را عمداً بیازمایید. در محیط آزمایشی مسیر اصلی را قطع کنید، مطمئن شوید ترافیک جابه‌جا می‌شود، مطمئن شوید درخواست حساس به مسیر غیرمجاز نمی‌لغزد و زمان انتظار کاربر را اندازه بگیرید.

سنجش کیفیت فارسی پیش از تعهد

جدول‌های رتبه‌بندی عمومی درباره کار مشخص شما چیز زیادی نمی‌گویند و پژوهش‌های دانشگاهی دلیلش را نشان می‌دهند. یک ارزیابی مدل‌های متن‌باز روی وظایف فارسی در ۲۰۲۵ نشان داد بیشتر مدل‌ها در وظایف سطح واژه مانند شناسایی موجودیت‌های نام‌دار ضعیف‌اند، حتی وقتی در استدلال خوب عمل می‌کنند. ارزیابی MELAC نوزده مجموعه‌داده فارسی در موضوع‌هایی مانند قانون ایران، دستور زبان فارسی، اصطلاحات و آزمون ورودی دانشگاه ساخت و ۴۱ مدل را سنجید، چون آزمون‌های غرب‌محور این دانش را نمی‌بینند.

پیش از انتخاب مسیر، مجموعه آزمون کوچک و نسخه‌داری از داده‌های خودتان بسازید: فارسی رسمی و محاوره‌ای، کاربرد ناهمسان نیم‌فاصله، گونه‌های عربی و فارسی «ی» و «ک»، رقم فارسی و لاتین، تاریخ شمسی، اصطلاحات آمیخته فارسی و انگلیسی و اگر با آن‌ها سروکار دارید، اسناد اسکن‌شده و جدول‌دار. همه مسیرهای نامزد، از جمله مدل‌های مسیر جایگزین، را روی همین مجموعه بسنجید؛ حالت کاهش‌یافته هم بخشی از محیط تولید است.

کد کمینه‌ای که ارائه‌دهنده را با پیکربندی عوض می‌کند

چون همه مسیرهای بالا می‌توانند با قالب سازگار با OpenAI حرف بزنند، کد برنامه می‌تواند ثابت بماند و فقط ارائه‌دهنده عوض شود. نمونه زیر از بسته رسمی openai در پایتون استفاده می‌کند، هر مسیر را از متغیرهای محیطی می‌خواند و فقط در خطاهایی به مسیر بعدی می‌رود که مسیر دیگری بتواند رفعشان کند.

# pip install openai
import os
from openai import OpenAI, APIConnectionError, APITimeoutError, APIStatusError

# Order is preference. Each route is configuration, not code.
ROUTES = [
    {   # self-hosted vLLM, started with: vllm serve <model> --api-key <key>
        "base_url": os.getenv("PRIMARY_BASE_URL", "http://localhost:8000/v1"),
        "api_key": os.getenv("PRIMARY_API_KEY", ""),
        "model": os.getenv("PRIMARY_MODEL", ""),
    },
    {   # a second OpenAI-compatible endpoint you are contracted to use
        "base_url": os.getenv("SECONDARY_BASE_URL", ""),
        "api_key": os.getenv("SECONDARY_API_KEY", ""),
        "model": os.getenv("SECONDARY_MODEL", ""),
    },
    {   # local Ollama for degraded mode; the SDK needs a key, the server ignores it
        "base_url": "http://localhost:11434/v1/",
        "api_key": "ollama",
        "model": os.getenv("LOCAL_MODEL", ""),
    },
]

RETRYABLE = {408, 429, 500, 502, 503, 504}

def ask(messages, timeout=30):
    failures = []
    for route in ROUTES:
        if not (route["base_url"] and route["model"]):
            continue
        client = OpenAI(base_url=route["base_url"], api_key=route["api_key"] or "unused",
                        timeout=timeout, max_retries=1)
        try:
            reply = client.chat.completions.create(model=route["model"], messages=messages)
            return route["base_url"], reply.choices[0].message.content
        except (APIConnectionError, APITimeoutError) as exc:
            failures.append(f"{route['base_url']}: {type(exc).__name__}")
        except APIStatusError as exc:
            if exc.status_code not in RETRYABLE:
                raise  # a bad request or bad key will not be fixed by another route
            failures.append(f"{route['base_url']}: HTTP {exc.status_code}")
    raise RuntimeError("all routes failed: " + "; ".join(failures))

used, text = ask([{"role": "user", "content": "این بند قرارداد را در دو جمله خلاصه کن: ..."}])
print(used, text)

در محیط تولید، بررسی صلاحیتِ بخش اقامت داده را پیش از حلقه اضافه کنید، مسیر پاسخ‌دهنده را همراه هر پاسخ ثبت کنید و فهرست مسیرها را در پیکربندی مدیریت‌شده نگه دارید تا عوض‌کردن ارائه‌دهنده یک تغییر عملیاتی باشد، نه انتشار نسخه تازه.

فهرست تصمیم

پیش از امضای هر قرارداد یا نوشتن نخستین خط اتصال، این پرسش‌ها را پاسخ دهید:

  1. کدام گردش‌کارها باید در قطع اتصال بین‌المللی کار کنند و کدام‌ها می‌توانند متوقف شوند؟
  2. برای هر مسیر نامزد، مدل دقیقاً کجا اجرا می‌شود؛ برای هر مدل و به‌صورت مکتوب؟
  3. آیا شرایط استفاده و سیاست کشوری منتشرشده ارائه‌دهنده، کاربرد شما را از محل شما و برای سازمان شما مجاز می‌داند؟ اگر پاسخ صادقانه به یک واسطه وابسته است، آن مسیر را کنار بگذارید.
  4. چه چیزی در لاگ می‌ماند، تا چه مدت، چه کسی آن را می‌خواند و حذف با چه شاهدی ثابت می‌شود؟
  5. قیمت چگونه تعیین می‌شود، با چه ارزی، و با تغییر نرخ ارز چه تغییری می‌کند؟
  6. هزینه هر کار موفق روی داده فارسی خودتان، با احتساب تکرار و بازبینی، چقدر اندازه‌گیری شده است؟
  7. برای هر طبقه داده کدام مسیر جایگزین مجاز است و آیا جابه‌جایی با قطع عمدی مسیر اصلی آزموده شده است؟
  8. هر مسیر، از جمله حالت کاهش‌یافته، روی مجموعه آزمون فارسی نسخه‌دار شما چه کیفیتی دارد؟
  9. اگر روزی جدا شوید، آیا می‌توانید دستورها، پیکربندی، داده ارزیابی و لاگ‌ها را بیرون ببرید؟
  10. مالک رابط، فهرست مسیرها و تصمیم جابه‌جایی کیست؟

افشای منفعت: ژرف برای سازمان‌ها سامانه‌های هوش مصنوعی طراحی و پیاده‌سازی می‌کند و از این رو در شیوه معماری آن‌ها منفعت تجاری دارد. هیچ‌یک از ارائه‌دهندگانی که در این راهنما نام برده شده‌اند برای حضور در آن پولی نپرداخته‌اند و این راهنما هیچ‌کدام را توصیه نمی‌کند. اگر بررسی مستقل گزینه‌های خود را می‌خواهید، از قواعد صلاحیت و طراحی مسیر جایگزین تا سنجش کیفیت فارسی، خدمت مشاوره هوش مصنوعی دقیقاً برای همین نوع تصمیم معماری است.

یادداشت منابع (بازبینی‌شده در ۲۰۲۶-۰۹-۲۴)

همه منابع در ۲ مهر ۱۴۰۵ (۲۴ سپتامبر ۲۰۲۶) بازبینی شدند. فهرست کشورها، شرایط استفاده و مستندات ارائه‌دهندگان بی‌اطلاع قبلی تغییر می‌کنند؛ پیش از اتکا به هر گزاره این متن، آن‌ها را دوباره بررسی کنید.

#API هوش مصنوعی#ایران#زیرساخت مدل زبانی#میزبانی مدل باز#Ollama#اقامت داده#مسیریابی مدل

مطالب مرتبط

یک فرایند را برای کشف نیاز مشخص کنید

اگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.