
مغز کوچکتر: هوش مصنوعی لبه و مدلهای زبانی کوچک
مدلهای زبانی کوچک، استقرار هوش مصنوعی را تغییر میدهند و استدلال مفید را به دستگاه، شبکه خصوصی و گردشکار حساس به تأخیر نزدیکتر میکنند.
ادامه مطلبتیم ژرف ایآی

مدل کوچک روی تلفن، دوربین، خودرو، پوشیدنی، مرورگر یا کنترلر صنعتی میتواند تصویر، صدا، متن و حسگر را بدون ارسال همه ورودی خام به ابر بفهمد. این معماری تأخیر، حریم خصوصی، کار آفلاین، هزینه و دامنه خرابی را تغییر میدهد؛ اما محیط یکنواخت سرور را نیز با هزاران ترکیب سختافزار و سیستمعامل عوض میکند.
پرسش درست فقط «آیا مدل روی دستگاه اجرا میشود؟» نیست. باید پرسید «آیا کل قابلیت روی ضعیفترین دستگاه پشتیبانیشده، زیر فشار حافظه، گرما، نور، صدا، شبکه و باتری همان وعده را حفظ میکند؟»
مدل چندوجهی محلی برای کارهای زیر مناسب است:
کارهایی که دانش وسیع روز، زمینه بسیار بلند، تحلیل چندین فریم با وضوح بالا یا برنامهریزی باز میخواهند معمولاً برای مدل کوچک محلی مناسب نیستند. طراحی ترکیبی میتواند رسانه خام را روی دستگاه نگه دارد، فقط نمایش ساختاریافته مجاز را به ابر بفرستد و نتیجه را برای اقدام برگرداند.
وعده را اندازهپذیر بنویسید. «کمک هوش مصنوعی با دوربین» مبهم است. «تشخیص دیدهشدن چهار گوشه کارت با تأخیر صدک ۹۵ کمتر از ۱۵۰ میلیثانیه و بدون آپلود preview» قابل آزمون است.
یک تصمیم برای کل قابلیت نگیرید:
| مرحله | دستگاه بهتر است وقتی | ابر بهتر است وقتی |
|---|---|---|
| ثبت و فیلتر | رسانه خام حساس یا پرحجم است | ثبت مرکزی الزام دارد |
| ادراک اولیه | تأخیر و آفلاین مهم است | شتابدهنده سرور برای کیفیت لازم است |
| بازیابی | دانش کوچک، خصوصی و محلی است | corpus بزرگ یا دائماً متغیر است |
| استدلال | کار محدود و زمینه کوتاه است | دانش وسیع یا زمینه بلند لازم است |
| اقدام | سختافزار باید فوری پاسخ دهد | اقدام به وضعیت مرجع سرور وابسته است |
| تحلیل | تجمیع کمخطر کافی است | تحلیل مرکزی جزئی مبنای معتبر دارد |
معماری ترکیبی باید انتقال داده را واقعاً کم کند. دقیق بنویسید کدام feature vector، crop، transcript یا فایل تأییدشده اجازه خروج دارد. راهنمای حریم خصوصی در هوش مصنوعی روی دستگاه مرز داده و مطلب مدل زبانی کوچک در لبه انتخاب مدل را بررسی میکند.
دستگاههای پشتیبانیشده را فهرست کنید:
یک tier حداقلی و tierهای بهتر تعریف کنید. اگر یک artifact برای همه مناسب نیست، با capability handshake نسخه تأییدشده را انتخاب کنید. هرگز بیصدا از پردازش محلی به آپلود ابری برنگردید؛ این کار وعده حریم را تغییر میدهد و رضایت روشن میخواهد.
Google AI Edge استقرار شتابگرفته و benchmark روی دستگاه واقعی Android را پشتیبانی میکند. Core ML اپل اجرا روی CPU، GPU و Neural Engine را با توجه به حافظه و توان بهینه میکند. این runtimeها اجرا را آسان میکنند، اما جای آزمون کیفیت محصول را نمیگیرند.
فقط حجم فایل مدل تعیینکننده نیست. زمان شروع حسگر، decode، resize، normalize، بارگذاری، warm-up، اولین خروجی، inference مداوم، post-processing و بهروزرسانی UI را جدا اندازه بگیرید. اوج حافظه، fragmentation، مصرف باتری، throttling و زمان دانلود نیز مهماند.
ابتدا کار پرهزینه را حذف کنید. crop کوچکتر یا inference رویدادمحور شاید از فشردهسازی شدید وزن بیشتر سود دهد. buffer را بازاستفاده، تبدیل رسانه تکراری را حذف و model lifecycle را با محدودیت سیستمعامل هماهنگ کنید.
برای صدا یا ویدیوی پیوسته، cascade بسازید:
آشکارساز ارزان -> پنجره محتمل -> مدل محلی غنیتر -> گام ابری اختیاری با رضایت
مرحله ارزان را برای رخداد ازدسترفته بسنجید؛ cascade سریع اگر حالت مهم را حذف کند بیفایده است.
کوانتیزهسازی، pruning، distillation و تغییر معماری میتوانند حافظه و تأخیر را کم کنند، اما الگوی خرابی را نیز تغییر میدهند.
پس از هر artifact:
«کمتر از یک امتیاز افت میانگین» کافی نیست. فشردهسازی ممکن است لهجه، گفتار آرام، نور کم، شیء کوچک، تاری حرکت یا حسگر قدیمی را بیشتر خراب کند.
ماتریس باید ضعیفترین دستگاه، میانرده رایج، مرجع قوی، cold و warm start، فشار پسزمینه، حالت کمباتری، دستگاه گرم، کمبود حافظه و نسخههای سیستمعامل را پوشش دهد.
میانه و tail latency، اوج حافظه، انرژی هر کار، throughput مداوم، kill rate و کیفیت همان artifact نهایی را گزارش کنید.
MLPerf Mobile v6.0 در ژوئن ۲۰۲۶ آزمون LLM روی موبایل را به workloadهای دیداری و تولید تصویر افزود. تعریف benchmark موبایل نشان میدهد عملکرد و هدف کیفیت باید کنار هم باشند. benchmark استاندارد برای مقایسه پلتفرم مفید است، اما benchmark محصول با حسگر، ورودی، preprocessing و بودجه تأخیر واقعی لازم میماند.
نور کم و ترکیبی، glare، سایه، پوشیدگی، لرزش، چرخش، فاصله، شیء کوچک، لنز کثیف، رنگ پوست، سند فرسوده، ثبت دوباره نمایشگر و الگوی خصمانه.
لهجه و گویش، اختلال گفتاری، گفتار آرام، چند گوینده، پژواک، باد، ماشینآلات، موسیقی، میکروفن مختلف، packet loss و playback attack.
حسگر مفقود، drift ساعت، orientation، تفاوت calibration، مجوز مکان، حرکت، sample rate متغیر و وضعیت محلی کهنه.
تعارض کانالها، timestamp ناهماهنگ، خرابی یک modality و مدل مطمئنی که کانال آسانتر را بیش از حد وزن میدهد.
داده میدانی رضایتمندانه، شبیهسازی کنترلشده و تقویت مصنوعی با محدودیت مستند را ترکیب کنید. مصنوعی نباید جای آزمون واقعی را بگیرد؛ حکمرانی داده مصنوعی را ببینید.
پردازش محلی انتقال رسانه خام را کم میکند، اما feature خودکار خصوصی نیست. cache، embedding، transcript، crash log، analytics، screenshot و backup میتوانند اطلاعات را بیرون ببرند.
کنترلها:
استخراج مدل، adversarial example، تزریق پرامپت از تصویر یا صدا و update آلوده را مدل تهدید کنید. مدل محلی شاید به دوربین، میکروفن، فایل یا clipboard دسترسی داشته باشد؛ اصل کمترین اختیار همچنان برقرار است.
دستگاه باید اطمینان کم، ورودی پوشیده یا noisy، زبان و حسگر پشتیبانینشده، فشار حافظه، throttling، مدل منقضی و نبود شبکه را تشخیص دهد.
راه بازیابی دقیق بدهید: نور را بهتر کنید، نزدیکتر شوید، عبارت را تکرار کنید، بسته زبان را دانلود کنید، صبر کنید دستگاه خنک شود، مسیر دستی را ادامه دهید یا با رضایت از ابر استفاده کنید. کار کاربر را حفظ کنید.
«نمیتوانم این تصویر را روی این دستگاه راستیآزمایی کنم» بهتر از حدس روان است. کیفیت خودداری بخشی از کیفیت کار است.
artifact را امضا و hash کنید؛ نسخه آموزش، ارزیابی، runtime و بهینهسازی را ثبت کنید؛ همه tierها را بیازمایید؛ rollout مرحلهای و مقایسه کیفیت، تأخیر، توان و fallback داشته باشید؛ rollback امن نگه دارید؛ و برای دستگاهی که مدل تازه را اجرا نمیکند پایان پشتیبانی تعریف کنید.
شناسه نسخه و outcome کمخطر را ثبت کنید تا نسخه قدیم و جدید در تحلیل گم نشوند.
کوچکترین یا سریعترین مدل الزاماً بهترین نیست. معیار، نتیجه موفق کاربر داخل بودجه سختافزار، حریم و انرژی است.
برای دروازه انتشار، چکلیست آمادگی تولید هوش مصنوعی را اجرا کنید.
فقط اگر کل feature همینطور طراحی شده باشد. analytics، crash log، backup، fallback و سرویس متصل ممکن است داده منتقل کنند. جریان کامل را مستند و آزمون کنید.
بهاندازهای کوچک که روی ضعیفترین دستگاه، کیفیت، tail latency، حافظه، انرژی، ذخیره و پشتیبانی را حفظ کند. تعداد پارامتر رفتار runtime را بهتنهایی پیشبینی نمیکند.
اگر envelope را حفظ میکند، بله. در غیر این صورت tierهای آزمودهشده با انتخاب بر اساس capability بسازید و رفتار حریم و feature را ثابت و آشکار نگه دارید.
خیر. مدل تخصصی محلی در کار محدود میتواند بهتر باشد. artifact واقعی را روی داده نماینده مقایسه کنید.
این راهنما در ۸ مرداد ۱۴۰۵ (۳۰ ژوئیه ۲۰۲۶) بهطور اساسی با منابع زیر بازبینی شد:
هوشمندی لبه به دلیل فوریت و حریم خصوصی ارزش دارد. طراحی قوی، مدل کوچک را مسئول یک وعده کوچک اما مهم میکند و همان وعده را روی سختافزار واقعی ثابت میکند.

مدلهای زبانی کوچک، استقرار هوش مصنوعی را تغییر میدهند و استدلال مفید را به دستگاه، شبکه خصوصی و گردشکار حساس به تأخیر نزدیکتر میکنند.
ادامه مطلب
داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعیبودن به معنی ناشناس یا بیخطر بودن نیست.
ادامه مطلب
راهنمای عملی ساخت حافظه هوش مصنوعی که با تغییر انسان، مجوز و ترجیح مفید بماند و هر گفتوگوی قدیمی را به حقیقت دائمی تبدیل نکند.
ادامه مطلبگزارش روزانه و راهنماهای عملیاتی ژرف را ببینید. این صفحه یک آرشیو موضوعی است، نه دعوت به شروع پروژه.