
Claude Opus 5.5؛ عامل مرزی ارزانتر با حفاظت سختگیرانهتر
مدل ۳۱ شهریور آنتروپیک در بیشتر بنچمارکهای عاملی پیش است، خواندن کش را ۶۰ درصد ارزان میکند و چهار تغییر شکننده رابط و حفاظت همرده Fable را به Opus میآورد.
ادامه مطلبراهنمای بیطرف دسترسی قانونی به API هوش مصنوعی در ایران: سرویسهای داخلی، درگاههای واسط، میزبانی مدل باز، سنجش کیفیت فارسی، روش محاسبه هزینه و کدی با مسیر جایگزین.

هر شرکت ایرانی که بخواهد مدل زبانی بزرگ را وارد محصول، پشتیبانی مشتری یا گردش اسناد خود کند، دیر یا زود به یک پرسش عملی میرسد: از همینجا به کدام API هوش مصنوعی میتوان وصل شد، بیآنکه کسبوکار روی چیزی بنا شود که هر لحظه ممکن است خاموش شود؟ پاسخ کوتاه این است که یک تأمینکننده امن و همیشگی وجود ندارد. چند مسیر مشروع وجود دارد: سرویس داخلی API هوش مصنوعی، مدل باز روی سرور خودتان، و در موارد محدود سکوی خارجی که شرایط استفادهاش واقعاً کاربرد شما را مجاز میداند. معماری پایدار همه این مسیرها را پشت یک رابط واحد میگذارد که در اختیار تیم خودتان است.
این راهنما برای مدیران فنی، معماران نرمافزار و توسعهدهندگانی نوشته شده است که باید این تصمیم را با شاهد بگیرند. توضیح میدهیم چرا APIهای خارجی آشنا از ایران بهسختی قابل استفادهاند، گزینههای داخلی و میزبانی شخصی بر پایه مستندات خودشان دقیقاً چه میدهند، سختافزار را چگونه برآورد کنیم، هزینه را بدون اعتماد به قیمت تبلیغاتی چطور مقایسه کنیم، کیفیت فارسی را چگونه بیازماییم و کدی بنویسیم که ارائهدهنده را فقط با تغییر پیکربندی عوض کند.
یک مرز را آگاهانه نگه میداریم: این متن هیچ روشی برای دورزدن تحریم، مسدودسازی جغرافیایی، احراز هویت یا شرایط استفاده ارائهدهندگان آموزش نمیدهد و فروشندگان واسطه حساب را هم معرفی نمیکند. چنین میانبرهایی داده، حساب و تداوم کار شما را به توافقی میسپارند که بیخبر پایان مییابد. همه آنچه در ادامه میآید گزینههایی است که میتوان در برابر هیئتمدیره، حسابرس و مشتری از آن دفاع کرد.
چهار مانع جدا روی هم جمع میشوند و هرکدام به شکل متفاوتی کار را متوقف میکنند.
سیاست ارائهدهنده. ارائهدهندگان اصلی مدل، فهرست کشورهای تحت پوشش خود را منتشر میکنند و ایران در هیچکدام نیست. صفحه کشورهای پشتیبانیشده OpenAI ایران را فهرست نمیکند و هشدار میدهد که دسترسی یا «فراهمکردن دسترسی» به خدماتش بیرون از این فهرست ممکن است به مسدود یا تعلیقشدن حساب بینجامد. عبارت فراهمکردن دسترسی مهم است، چون واسطهها را هم در بر میگیرد و فقط کاربر نهایی را نه. صفحه مناطق پشتیبانیشده Anthropic نیز ایران را ندارد و حق خودداری از خدمترسانی به نهادهایی را که مالکیت اکثریتشان به کشورهای بیرون از فهرست برمیگردد برای خود محفوظ میداند. گوگل هم در صفحه مناطق دردسترس Gemini API که آخرین بار در اردیبهشت ۱۴۰۵ بهروز شده، ایران را فهرست نکرده است.
قانون تحریم. پشت این فهرستها، برنامه تحریمهای ایران قرار دارد که دفتر کنترل داراییهای خارجی وزارت خزانهداری آمریکا (OFAC) آن را اداره میکند و مقررات تحریمها و معاملات ایران بخشی از آن است. صفحه برنامه تحریمهای ایران در OFAC نشان میدهد این برنامه فعال است و حتی در شهریور ۱۴۰۵ نیز نامگذاریهای تازه داشته است. OFAC برای برخی ابزارهای ارتباطات شخصی مجوز عمومی صادر کرده است، اما اینکه کاربرد تجاری مشخصی از یک API زیر چنین مجوزی قرار بگیرد یا نه، پرسشی برای مشاور حقوقی واجد صلاحیت است. در عمل خود ارائهدهندگان ایران را کشور پشتیبانینشده اعلام کردهاند. همین چارچوب صادرات کالای آمریکایی را هم محدود میکند و این نکته هنگام خرید پردازنده گرافیکی دوباره اهمیت پیدا میکند.
پرداخت و احراز هویت. سکوهای خارجی از راه کارت و شبکه بانکی بینالمللی صورتحساب میفرستند و حساب را با کشورهای پشتیبانیشده تطبیق میدهند. کارت و حساب صادرشده در ایران معمولاً نمیتواند این چرخه را کامل کند و بازار خاکستری واسطهها دقیقاً از همینجا شکل گرفته است؛ همان وابستگیای که این راهنما از آن پرهیز میدهد.
خود شبکه. اتصال بینالمللی از ایران تضمینشده نیست. گزارش اختلالهای سهماهه نخست ۲۰۲۶ کلادفلر قطعی سراسریای را ثبت کرده که از ۱۸ دی ۱۴۰۴ (۸ ژانویه ۲۰۲۶) آغاز شد، ترافیک تا ۱ بهمن تقریباً صفر ماند و بازگشت کاملتر از ۷ بهمن شروع شد. قطعی دوم از ۹ اسفند ۱۴۰۴ (۲۸ فوریه) آغاز شد و دسترسی در آن با «فهرست سفید» و «سیمکارت سفید» محدود شد. گزارش پیگیری کلادفلر در خرداد ۱۴۰۵ از بازگشت فقط بخشی از اتصال در ۵ خرداد خبر میدهد؛ یعنی ۸۷ روز پس از آغاز قطعی دوم. در آن هفتهها هر گردشکاری که به مدل میزبانیشده در خارج وابسته بود، بهسادگی متوقف شد. به همین دلیل جستوجوی «api هوش مصنوعی نت ملی» یک نیاز عملیاتی است، نه کنجکاوی.
پیش از مقایسه برندها، مسیرها را مقایسه کنید. مهمترین پرسش این است که مدل از نظر فیزیکی کجا اجرا میشود، چون همین یک واقعیت اقامت داده، تداوم خدمت و ریسک حقوقی را تعیین میکند.
| مسیر | محل اجرای مدل | در قطع اتصال بینالمللی کار میکند؟ | ریسک شرایط استفاده و تحریم | شکل هزینه |
|---|---|---|---|---|
| ارائهدهنده خارجی، مستقیم | مراکز داده ارائهدهنده در خارج | خیر | ایران بیرون از فهرست ارائهدهندگان اصلی است | بهازای توکن، با ارز خارجی |
| درگاه واسط یا مسیریاب خارجی | در خارج، روی هر ارائهدهندهای که درگاه انتخاب کند | خیر | شرایط خود درگاه بهعلاوه محدودیتهای هر ارائهدهنده بالادست | بهازای توکن، با ارز خارجی |
| سرویس داخلی API هوش مصنوعی | در ایران برای مدلهای میزبانیشده روی سرور خود ارائهدهنده؛ در خارج برای مدلهای خارجیِ بازارسالشده | فقط برای مدلهایی که واقعاً در ایران اجرا میشوند | مدل خارجیِ بازارسالشده همچنان تابع شرایط بالادست است | ریالی؛ بپرسید قیمت توکن به چه چیزی گره خورده است |
| مدل باز روی سرور خودتان | سرور سازمان یا ماشین اجارهای در ابر داخلی | بله، اگر سرور و کاربران در یک سوی شبکه باشند | مجوز انتشار مدل و قانونیبودن مسیر تأمین سختافزار | عمدتاً ثابت: سختافزار، برق و نیروی فنی |
بیشتر سازمانها به ترکیبی میرسند: مسیر داخلی یا میزبانی شخصی برای هر کار حساس یا حیاتی، و فرایند استثنای محدود و مکتوب برای بقیه. راهنمای انتخاب میان ابزار بومی و خارجی هوش مصنوعی این لایهبندی را از نگاه کسبوکار بررسی کرده است؛ این مقاله به سازوکار فنی اتصال از راه API میپردازد.
جستوجوهایی مانند «خرید API هوش مصنوعی» و «api هوش مصنوعی ایرانی» بهسرعت به شرکتهای ابری داخلی میرسند که دسترسی به هوش مصنوعی را از راه یک API واحد میفروشند. آروانکلاد و لیارا دو نمونهاند که برای این سرویس مستندات عمومی منتشر کردهاند. ترتیب آمدن نامشان رتبهبندی نیست و توصیف زیر فقط از مستندات خودشان برداشته شده است.
مستندات سرویس هوش مصنوعی آروانکلاد از نقطه دسترسی خصوصی برای هر مدل با کلیدی که خود مشتری میسازد، گزارش مصرف توکن همراه با هزینه، و محدودیت نرخ درخواست در ثانیه یا دقیقه برای هر نقطه دسترسی سخن میگوید. همین صفحه میگوید برخی مدلها مستقیماً روی زیرساخت خود آروان میزبانی میشوند، قابلیت پایگاه دانش برای پاسخگویی از دادههای خود مشتری دارد، فعلاً امکان تنظیم دقیق یا آموزش مدل وجود ندارد و تاریخچه گفتوگو میان درخواستها ذخیره نمیشود.
مستندات سرویس هوش مصنوعی لیارا سرویسی را توصیف میکند که فهرست مدلهایش هم خانوادههای بسته خارجی مانند GPT از OpenAI، Gemini از گوگل، Claude از Anthropic و Grok را در بر میگیرد و هم خانوادههای باز مانند Llama، Mistral و Qwen را. صفحه معرفی این سرویس نمیگوید هر مدل کجا پردازش میشود و کدام مدل، اگر مدلی باشد، روی سرورهای داخل ایران اجرا میشود.
نکته اصلی همین خلأ است. وقتی یک سرویس داخلی GPT، Claude یا Gemini را عرضه میکند، درخواست به مدلی خارجی بازارسال میشود: متن شما از کشور خارج میشود، سیاست کشوری و شرایط ارائهدهنده بالادست همچنان بر آن ترافیک حاکم است و با قطع اتصال بینالمللی، این مسیر هم قطع میشود. مدل بازی که روی سرورهای خود ارائهدهنده در ایران اجرا میشود، محصولی واقعاً متفاوت با ویژگیهای متفاوت است. پیش از هر خرید، از هر ارائهدهنده برای هر مدل پاسخ مکتوب این چهار پرسش را بخواهید: اجرای مدل کجاست، چه چیزی و تا چه مدت در لاگ میماند، کدام طرف سوم داده را دریافت میکند، و کدام مدلها در قطعیهای ۱۴۰۴ و ۱۴۰۵ در دسترس ماندند.
توجه توسعهدهندگان ایرانی به OpenRouter و ابزارهای مسیریابی محلی در سال ۱۴۰۵ آشکارا بیشتر شده است؛ پس بهتر است دقیق بدانیم این ابزارها چه هستند و چه کاری از آنها برنمیآید.
OpenRouter یک API یکپارچه در برابر صدها مدل از ارائهدهندگان گوناگون است و نشانی پایهای سازگار با قالب OpenAI دارد. مستندات مسیریابی ارائهدهنده در OpenRouter توضیح میدهد که بهطور پیشفرض ارائهدهندگانی را ترجیح میدهد که اخیراً قطعی نداشتهاند، از میان ارائهدهندگان پایدار قیمت پایینتر را وزن بیشتری میدهد، هنگام خطای یک ارائهدهنده سراغ بعدی میرود و با گزینهای مانند zdr میتوان درخواستها را فقط به نقاطی فرستاد که سیاست عدم نگهداری داده دارند. اینها ایدههای مهندسی ارزشمندیاند.
شرایط استفاده OpenRouter که آخرین بار در ۹ شهریور ۱۴۰۵ (۳۱ اوت ۲۰۲۶) بهروز شده، به همان اندازه مهم است. طرف این شرایط شرکت OpenRouter, Inc. در نیویورک است و بنابراین خودش مشمول همان برنامه تحریم آمریکاست. متن شرایط میگوید برخی ارائهدهندگان مدل به کاربرانی که در کشورها یا مناطق معینی هستند اجازه دسترسی نمیدهند، این «مدلهای محدودشده» را نمیتوان از راه این سرویس به کار گرفت و استفاده از سرویس برای فروش مجدد دسترسی API ممنوع است. درگاه واسط محدودیتهای بالادست را از بین نمیبرد؛ همه آنها را به ارث میبرد و محدودیتهای خودش را هم میافزاید. برای شرکت ایرانی این یک ریسک حقوقی و تداومی است که باید با مشاور حقوقی سنجیده شود، نه راهحل.
مسیریابهای محلی دسته دیگریاند. ابزارهایی که توسعهدهندگان ایرانی با نامشان جستوجو میکنند، مانند 9router یا claude-code-router، روی رایانه خودتان بهعنوان پراکسی محلیِ سازگار با OpenAI اجرا میشوند، قالبهای مختلف API را به هم ترجمه میکنند و میان مقصدهای بالادستی که تعریف کردهاید جابهجا میشوند. این ابزارها لولهکشی را عوض میکنند، نه حقوق را: هر درخواست همچنان به حساب مشروع در بالادست نیاز دارد. برخی از آنها چرخاندن چند حساب یا رویهمگذاشتن سهمیههای رایگان را برای فرار از محدودیت تبلیغ میکنند و این دقیقاً همان رفتاری است که بیشتر شرایط استفاده ممنوع کردهاند. هیچ شرکتی نباید بار تولیدی خود را روی این الگو بنا کند.
اجرای مدل باز روی سرور خودتان تنها مسیری است که کل راه، از ورودی تا پاسخ، در کنترل شماست. سه سرور متنباز پخته، رابطی سازگار با قالب OpenAI ارائه میکنند؛ یعنی کد برنامه هنگام جابهجایی میان آنها، یا ترک همهشان، لازم نیست تغییر کند.
http://localhost:11434/v1/ را به کار میبرد، کلیدی میخواهد که کتابخانه لازم دارد اما سرور نادیدهاش میگیرد، و از تکمیل گفتوگو، تکمیل متن، ساخت بردار تعبیه، فهرست مدلها و بخش بیحالت Responses API پشتیبانی میکند. کمبودهایش را هم نوشته است، مانند نبود tool_choice و احتمال لگاریتمی.vllm serve و نام مدل و در صورت نیاز --api-key راه میاندازد و برنامهها به http://localhost:8000/v1 وصل میشوند./v1/chat/completions و /v1/completions را بهطور پیشفرض روی درگاه ۸۰۸۰ توصیف میکند.در میان مدلهای باز، کار متمرکز بر فارسی هم هست. کارت مدل Dorna2 از شرکت پارت مدلی هشتمیلیارد پارامتری بر پایه Llama 3.1 را توصیف میکند که برای فارسی تطبیق داده شده، با مجوز Llama 3.1 منتشر شده و میانگین ۵۰٫۷۲ درصد در پنج آزمون فارسی را در برابر ۵۰٫۱۴ درصد مدل پایه گزارش میکند. این فاصله کوچک رقم اعلامی خود توسعهدهنده است و یادآوری خوبی است که برچسب فارسی فرضیهای برای آزمودن است، نه نتیجه. اداره مدل باز در محیط تولید، از نسخهگذاری و وصله امنیتی تا ارزیابی و بازگشت، در راهنمای عملیات مدلهای باز آمده است.
برآورد اولیه ساده است. راهنمای Hugging Face درباره بهینهسازی سرعت و حافظه مدلهای زبانی قاعده سرانگشتی میدهد: بارگذاری مدلی با X میلیارد پارامتر در دقت bfloat16 یا float16 حدود ۲ × X گیگابایت و در float32 حدود ۴ × X گیگابایت حافظه پردازنده گرافیکی میخواهد. در مثال همان راهنما، یک مدل برنامهنویسی ۱۵٫۵ میلیارد پارامتری در bfloat16 حدود ۲۹ گیگابایت، با کوانتیزهسازی هشتبیتی حدود ۱۵ گیگابایت و با کوانتیزهسازی چهاربیتی حدود ۹٫۵ گیگابایت مصرف کرد؛ با اندکی کندی و این هشدار که کوانتیزهسازی میتواند خروجی را تغییر دهد.
وزنهای مدل فقط آغاز ماجراست. حافظه نهان کلید-مقدار با طول متن ورودی و شمار کاربران همزمان بزرگ میشود؛ در همان راهنما، این حافظه برای همان مدل در ۱۶ هزار توکن بهتنهایی حدود ۱۵ گیگابایت لازم داشت، پیش از صرفهجوییهای معماری مانند توجه پرسشگروهی (GQA). برای طول واقعی ورودی، شمار درخواستهای همزمان و حاشیه اطمینان برآورد کنید و سپس روی خود سرور اندازه بگیرید.
دو واقعیت محلی هم باید در برنامه باشد. نخست، چارچوب تحریمی که صادرات کالای آمریکایی را محدود میکند سختافزار مرکز داده را هم در بر میگیرد؛ پس تأمین پردازنده گرافیکی باید در همان بازبینی حقوقیِ نرمافزار بررسی شود. دوم، ابرهای داخلی ماشین گرافیکی اجاره میدهند و میتوان پیش از هر خرید، مدل را در مقیاس واقعی آزمود؛ در این صورت همان پرسشهای اقامت داده و لاگ را که از ارائهدهنده API میپرسید، از ارائهدهنده ابر هم بپرسید.
«میزبانی در ایران» نقطه شروع است، نه کنترل. نخست دادهای را که وارد درخواستها میشود طبقهبندی کنید: پرونده مشتری، قرارداد، صورت مالی یا اطلاعات سلامت. سپس هر جایی را که درخواست از آن میگذرد نقشهبرداری کنید: سرور برنامه، درگاه، سرور مدل، لاگ، حافظه نهان، ابزار پایش و نسخه پشتیبان. مقاله اثبات اقامت دادههای هوش مصنوعی توضیح میدهد چرا برچسب منطقه در کنسول ابری ثابت نمیکند پردازش واقعاً کجا انجام شده است.
برای هر مسیر پاسخ مکتوب درباره مدت نگهداری، استفاده برای آموزش، پردازشگرهای فرعی، حذف و دسترسی کارکنان بگیرید. صلاحیت هر مسیر را پیش از رسیدن درخواست به مدل تعیین کنید: محتوای حساس نباید فقط برای فهمیدن اینکه به کجا تعلق دارد، به مسیری فرستاده شود که مجاز نیست. الزامهای ناشی از نهاد ناظر بخشی، قراردادها و سیاست داخلی در هر سازمان فرق میکند؛ آنها را با مشاور حقوقی واجد صلاحیت بررسی کنید، نه از روی صفحه تبلیغاتی فروشنده.
«api هوش مصنوعی ارزان» فقط وقتی ارزان است که کار را تمام کند. مسیرها را بر پایه هزینه هر کار موفق مقایسه کنید و این هزینه را از متغیرهایی بسازید که روی ترافیک خودتان اندازه میگیرید:
فارسی اندازهگیری جداگانه میخواهد. پژوهش بیعدالتی توکنسازها میان زبانها که در کنفرانس NeurIPS 2023 ارائه شد، نشان داد یک متن واحد پس از ترجمه به زبانهای مختلف ممکن است تا ۱۵ برابر تفاوت طول توکنی داشته باشد و این مستقیماً بر هزینه، تأخیر و حجم متنی که در پنجره مدل جا میشود اثر میگذارد. ضریب ثابتی برای فارسی فرض نکنید؛ نسبت توکن به نویسه را روی پیکره خودتان بشمارید.
میزبانی شخصی شکل دیگری دارد: خرید یا اجاره سختافزار، برق، سرمایش، مهندسی که پشته را بهروز نگه میدارد، آمادهباش خارج از ساعت کاری و ظرفیت بلااستفاده. این هزینه ثابت ماهانه را بر شمار کارهای موفقی که واقعاً اجرا میکنید تقسیم کنید. در حجم کم، API بهازای توکن معمولاً برنده است؛ در حجم بالا و پایدار، یا وقتی تداوم خدمت خودش قیمت دارد، میزبانی شخصی میتواند برنده شود. تنها مقایسه صادقانه همانی است که با اعداد خودتان حساب شده باشد.
ارزشمندترین تصمیم طراحی، رابطی داخلی است که برنامه بهجای تماس مستقیم با فروشنده آن را صدا میزند. پشت این رابط، فهرستی مرتب از مسیرهای مجاز نگه دارید که هرکدام نشانی پایه، کلید، نام مدل، مهلت پاسخ و سابقه کیفیت خود را دارد. وقتی مسیر اصلی با پایان مهلت، محدودیت نرخ یا خطای سرور شکست میخورد، رابط سراغ مسیر مجاز بعدی میرود و ثبت میکند کدام مسیر پاسخ داد.
مسیر جایگزین رایگان نیست. مدل محلی کوچکتر ممکن است برای دستهبندی کافی باشد و برای پاسخ مستقیم به مشتری نه؛ پس از پیش تعریف کنید سامانه در حالت کاهشیافته هنوز اجازه چه کاری دارد. راهنمای اینکه سامانه پس از ازکارافتادن مدل اصلی چه اختیاری دارد این قرارداد را شرح میدهد. انتخاب میان مسیرها بر پایه هزینه و کیفیت، و نه فقط دردسترسبودن، موضوع مقاله لایه مسیریابی مدل است. حافظه نهان پاسخهای تکراری هم هزینه را کم میکند و هم وابستگی به هر مسیر را، اما پاسخ ذخیرهشده ممکن است خطا را تکرار کند یا میان کاربران نشت کند؛ مقاله بازاستفاده امن از پاسخ هوش مصنوعی حفاظهای لازم را توضیح میدهد.
کل زنجیره را عمداً بیازمایید. در محیط آزمایشی مسیر اصلی را قطع کنید، مطمئن شوید ترافیک جابهجا میشود، مطمئن شوید درخواست حساس به مسیر غیرمجاز نمیلغزد و زمان انتظار کاربر را اندازه بگیرید.
جدولهای رتبهبندی عمومی درباره کار مشخص شما چیز زیادی نمیگویند و پژوهشهای دانشگاهی دلیلش را نشان میدهند. یک ارزیابی مدلهای متنباز روی وظایف فارسی در ۲۰۲۵ نشان داد بیشتر مدلها در وظایف سطح واژه مانند شناسایی موجودیتهای نامدار ضعیفاند، حتی وقتی در استدلال خوب عمل میکنند. ارزیابی MELAC نوزده مجموعهداده فارسی در موضوعهایی مانند قانون ایران، دستور زبان فارسی، اصطلاحات و آزمون ورودی دانشگاه ساخت و ۴۱ مدل را سنجید، چون آزمونهای غربمحور این دانش را نمیبینند.
پیش از انتخاب مسیر، مجموعه آزمون کوچک و نسخهداری از دادههای خودتان بسازید: فارسی رسمی و محاورهای، کاربرد ناهمسان نیمفاصله، گونههای عربی و فارسی «ی» و «ک»، رقم فارسی و لاتین، تاریخ شمسی، اصطلاحات آمیخته فارسی و انگلیسی و اگر با آنها سروکار دارید، اسناد اسکنشده و جدولدار. همه مسیرهای نامزد، از جمله مدلهای مسیر جایگزین، را روی همین مجموعه بسنجید؛ حالت کاهشیافته هم بخشی از محیط تولید است.
چون همه مسیرهای بالا میتوانند با قالب سازگار با OpenAI حرف بزنند، کد برنامه میتواند ثابت بماند و فقط ارائهدهنده عوض شود. نمونه زیر از بسته رسمی openai در پایتون استفاده میکند، هر مسیر را از متغیرهای محیطی میخواند و فقط در خطاهایی به مسیر بعدی میرود که مسیر دیگری بتواند رفعشان کند.
# pip install openai
import os
from openai import OpenAI, APIConnectionError, APITimeoutError, APIStatusError
# Order is preference. Each route is configuration, not code.
ROUTES = [
{ # self-hosted vLLM, started with: vllm serve <model> --api-key <key>
"base_url": os.getenv("PRIMARY_BASE_URL", "http://localhost:8000/v1"),
"api_key": os.getenv("PRIMARY_API_KEY", ""),
"model": os.getenv("PRIMARY_MODEL", ""),
},
{ # a second OpenAI-compatible endpoint you are contracted to use
"base_url": os.getenv("SECONDARY_BASE_URL", ""),
"api_key": os.getenv("SECONDARY_API_KEY", ""),
"model": os.getenv("SECONDARY_MODEL", ""),
},
{ # local Ollama for degraded mode; the SDK needs a key, the server ignores it
"base_url": "http://localhost:11434/v1/",
"api_key": "ollama",
"model": os.getenv("LOCAL_MODEL", ""),
},
]
RETRYABLE = {408, 429, 500, 502, 503, 504}
def ask(messages, timeout=30):
failures = []
for route in ROUTES:
if not (route["base_url"] and route["model"]):
continue
client = OpenAI(base_url=route["base_url"], api_key=route["api_key"] or "unused",
timeout=timeout, max_retries=1)
try:
reply = client.chat.completions.create(model=route["model"], messages=messages)
return route["base_url"], reply.choices[0].message.content
except (APIConnectionError, APITimeoutError) as exc:
failures.append(f"{route['base_url']}: {type(exc).__name__}")
except APIStatusError as exc:
if exc.status_code not in RETRYABLE:
raise # a bad request or bad key will not be fixed by another route
failures.append(f"{route['base_url']}: HTTP {exc.status_code}")
raise RuntimeError("all routes failed: " + "; ".join(failures))
used, text = ask([{"role": "user", "content": "این بند قرارداد را در دو جمله خلاصه کن: ..."}])
print(used, text)
در محیط تولید، بررسی صلاحیتِ بخش اقامت داده را پیش از حلقه اضافه کنید، مسیر پاسخدهنده را همراه هر پاسخ ثبت کنید و فهرست مسیرها را در پیکربندی مدیریتشده نگه دارید تا عوضکردن ارائهدهنده یک تغییر عملیاتی باشد، نه انتشار نسخه تازه.
پیش از امضای هر قرارداد یا نوشتن نخستین خط اتصال، این پرسشها را پاسخ دهید:
افشای منفعت: ژرف برای سازمانها سامانههای هوش مصنوعی طراحی و پیادهسازی میکند و از این رو در شیوه معماری آنها منفعت تجاری دارد. هیچیک از ارائهدهندگانی که در این راهنما نام برده شدهاند برای حضور در آن پولی نپرداختهاند و این راهنما هیچکدام را توصیه نمیکند. اگر بررسی مستقل گزینههای خود را میخواهید، از قواعد صلاحیت و طراحی مسیر جایگزین تا سنجش کیفیت فارسی، خدمت مشاوره هوش مصنوعی دقیقاً برای همین نوع تصمیم معماری است.
همه منابع در ۲ مهر ۱۴۰۵ (۲۴ سپتامبر ۲۰۲۶) بازبینی شدند. فهرست کشورها، شرایط استفاده و مستندات ارائهدهندگان بیاطلاع قبلی تغییر میکنند؛ پیش از اتکا به هر گزاره این متن، آنها را دوباره بررسی کنید.

مدل ۳۱ شهریور آنتروپیک در بیشتر بنچمارکهای عاملی پیش است، خواندن کش را ۶۰ درصد ارزان میکند و چهار تغییر شکننده رابط و حفاظت همرده Fable را به Opus میآورد.
ادامه مطلب
خوانش بخشبهبخش کارت سیستم ۲۳۰ صفحهای Opus 5.5؛ آستانههای زیستی و پژوهش هوش مصنوعی، ارزیابی سایبری، تزریق prompt، ممیزی همسویی، رفاه مدل و بنچمارکها.
ادامه مطلب
Jev بهجای نوشتن متن، پاسخ نوعدار با احتمال واسنجیشده برمیگرداند. نخستین مدل System One شرکت TypeSafe چه میکند، شواهد انتشارش چه میگوید و کجا کم میآورد.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.