
هشدارهای هوش مصنوعی را با نرخ رخداد واقعی بسنجید
وقتی رخداد نادر است، نرخ خطای پایین هم صفی از هشدارهای اشتباه میسازد. آستانه را با تعداد موارد ازدسترفته، سهم هشدارهای درست و ظرفیت بررسی انتخاب کنید.
ادامه مطلبتیم ژرف

فرض کنید گروه خرید دو دستیار را با ۴۰۰ پرسش قرارداد میسنجد. مدل دوم ۹ امتیاز جلو میافتد و آماده انتخاب میشود. بعد یکی از مهندسان میبیند ۶۰ پرسش از مخزنی عمومی آمده که برای تنظیم دستور استفاده شده، عامل هنگام اجرا به صفحههای پاسخ دسترسی وب داشته و همان پرسشها در گزارش هفتگی با هر دو فروشنده به اشتراک گذاشته شده است.
حساب نمره درست است؛ شاهد تصمیم نه.
اکنون پرسش واقعی این است: آیا این نمره هنوز میتواند انتخاب مدل یا مجوز انتشار را پشتیبانی کند، یا باید محدود، روی آزمونی محبوس تکرار، یا کنار گذاشته شود؟ پاسخ به دفتر مواجهه آزمون نیاز دارد، نه ادعای مطمئن «پاکبودن» بنچمارک.
هر نتیجه ارزیابی دستکم چهار چیز را به هم وصل میکند: سامانه هوش مصنوعی با پیکربندی معین، مجموعه کارها، محیط اجرا و سنجه. آلودگی زمانی رخ میدهد که دیدن سؤال، جواب، نمونه نزدیک یا منبعی که راهحل را میسازد، معنای نتیجه را تغییر دهد. بهجای سنجش کار نادیده، آزمون شاید بخشی از حفظکردن، تنظیم قبلی، مهارت بازیابی یا شناخت داور را اندازه بگیرد.
هر مواجههای تخلف نیست. نمونه عمومی برای آموزش تیم، عیبیابی و مقایسه مفید است. خطا زمانی آغاز میشود که همان مجموعه آشنا را شاهدی مستقل معرفی کنیم. پرسشی که با آن دستور را اصلاح کردهایم میتواند آزمون بازگشت همان اصلاح بماند؛ اما دیگر ثابت نمیکند دستور تازه روی کار ندیده نیز تعمیم مییابد.
راهنمای ارزیابی مدلهای مرزی سبد کاملتری از سنجش را شرح میدهد. اینجا تصمیم محدودتر است: با توجه به کل مسیر مواجهه، یک نمره چه اعتباری دارد؟
منابع اصلی تازه، مسئلهای مشترک را از چند زاویه نشان میدهند.
برنامه تازه ارزیابی فناوری هوش مصنوعی NIST میگوید در مرحله اولیه از داده کور و محیط محبوس استفاده میکند تا خطر آمیختن آموزش و آزمون کم شود. ارائهدهنده داده، مجموعه اصلی را از دسترس ارائهدهنده مدل دور نگه میدارد و مدلها با کار و سنجه مشترک ارزیابی میشوند. این برنامه در حال توسعه NIST است، نه گواهی آماده برای ارزیابی داخلی هر سازمان.
Google DeepMind در مطلب ۲۷ اوت ۲۰۲۶ درباره آزمایش ارزیابی دوسوکور محیطی با حفاظت رمزنگاری را توصیف میکند که هم پرسش محرمانه ارزیاب را از مالک مدل پنهان نگه میدارد و هم وزن اختصاصی مدل را از ارزیاب. گوگل آن را نخستین ارزیابی دوسوکور یک مدل مرزی اختصاصی مینامد. این توصیف خود گوگل از آزمایش است و ثابت نمیکند هر بنچمارک محرمانه دقیقاً به همین زیرساخت نیاز دارد.
راهنمای ۲۹ مه ۲۰۲۶ OpenAI برای ارزیابی شخص ثالث قابل اعتماد میان ادعای آزمون و شاهد اعتبار نتیجه فرق میگذارد. آلودگی را کنار دستکاری پاداش، امتناع، سؤال خراب و کمکاری عمدی میگذارد و یادآور میشود سؤال یا جواب شاید در داده آموزش باشد یا عامل از راه مرور وب آن را پیدا کند.
تحلیل NIST CAISI از تقلب در ارزیابی عاملها مرز دیگری میگذارد: در آلودگی راهحل، سامانه نادرست به اطلاعات پاسخ میرسد؛ در بازیدادن سنجه، از شکاف داوری عبور میکند بیآنکه مقصود کار را انجام دهد. هر دو میتوانند قبولی بسازند بیآنکه ادعای اصلی را پشتیبانی کنند.
اینها یافتههای منبعاند. دفتر مواجهه، چهار حکم نتیجه و دروازه انتشار در ادامه، جمعبندی عملی ژرف است.
وجود فایل دقیق آزمون در داده پیشآموزش فقط آشکارترین راه است. پنج لایه را جدا ببینید:
۱. مواجهه مدل: سؤال، جواب، معیار داوری یا نمونه نزدیک وارد پیشآموزش، تنظیم، داده ترجیح، تقطیر، تولید داده مصنوعی یا آموزش ایمنی میشود. ۲. مواجهه توسعه: افراد با اقلام تصمیم، دستور، آستانه، بازیابی، ابزار، نسخه مدل یا شرط توقف را انتخاب میکنند. بازخورد پیاپی جدول رتبهبندی حتی بدون تغییر وزن، نقش سرپرستی دارد. ۳. مواجهه زمینه: سؤال یا پاسخ در دستور سامانه، نمونه ورودی، حافظه، کش، پیکره بازیابی، داده آزمایشی یا یادداشت ارزیابِ در دسترس اجرا قرار میگیرد. ۴. مواجهه ابزار: عامل از جستوجوی وب، تاریخچه بسته، نسخه تازهتر مخزن، خدمت پاسخ، عامل دیگر یا فضای کاری مشترک به راهحل میرسد. ۵. مواجهه سنجه: سامانه میآموزد بدون انجام کار موردنظر، شرط قبولی را برآورده کند؛ آزمون را تغییر دهد، سبک داور را هدف بگیرد، از خطای تجزیهگر بهره ببرد یا حالت مخصوص همان سؤال بسازد.
این مسیرها را به شکل یال میان بازیگر و دارایی ثبت کنید. «توسعهدهنده فایل جواب را باز نکرده» دفاع ضعیفی است اگر بهینهساز دستور، نمره تکتک سؤالها را گرفته یا مرورگر عامل به راهنمای حل رسیده باشد.
اثبات نبودن مواجهه دشوار است؛ بهخصوص وقتی پیکره آموزش مدل بسته در دسترس نیست. حتی با دسترسی به داده آموزش، تطبیق ظاهری محدودیت دارد. گزارش فنی GPT-4 روش تطبیق زیررشته را توضیح میدهد که نمونههای منطبق را حذف و نمره را دوباره محاسبه کرده است. همان گزارش احتمال منفی کاذب بر اثر تفاوت کوچک و مثبت کاذب بر اثر تطبیق ناقص را صریح میگوید و توضیح میدهد داده کوچکتر پسآموزش بهطور جداگانه بررسی نشده است.
مواجهه معنایی میتواند از نمایش دیگری عبور کند. مقاله اصلی EMNLP 2024 با عنوان آلودگی داده میتواند از مرز زبان بگذرد، مدلهای باز را عمداً با ترجمه مجموعه آزمون آموزش داد. عملکرد روی آزمون انگلیسی اصلی بالا رفت، در حالی که چند روش مبتنی بر حفظکردن نتوانستند مواجهه تزریقشده را بیابند. این آزمایش کنترلشده نمیگوید مدل تجاری معینی آلوده است؛ نشان میدهد «نبود تطبیق متن انگلیسی» مساوی «نبود مواجهه» نیست.
جمله قابل دفاع محدود است: کدام مسیر بررسی شد، چه شاهدی در دست بود، چه آزمونی اجرا شد و چه چیز نامعلوم ماند. از وضعیتهایی مانند در کنترلهای اعلامشده مواجهه شناختهشده ندارد، مواجهه مشکوک یا مواجهه نامعلوم استفاده کنید. جستوجوی هش را به گواهی تبدیل نکنید.
پیش از نخستین اجرا، رکورد را باز کنید. حداقل این موارد لازماند:
شناسه ارزیابی
ادعای تصمیم
نسخه کار و چکیده اقلام
منبع، تاریخ ساخت و مجوز هر قلم
طبقه محرمانگی و افراد مجاز
بخش تمرین، تنظیم، تصمیم یا نگهبان
چکیده پیکربندی مدل و سامانه
ابزار، دامنه، مخزن، داده و برش زمانی مجاز
نسخه سنجه، معیار و داور
اجرای پیشین و گیرنده بازخورد ریزدانه
بررسی همپوشانی، بازتولید و تعمیم
رویداد مواجهه قطعی، مشکوک و نامعلوم
وضعیت نتیجه، مالک و شرط انقضا
این دفتر را به خروجی خام، رد ابزارهای مشاهدهپذیر، فایل داوری، حذفها و گزارش نهایی ببندید. راهنمای شاهد حسابرسی هوش مصنوعی شیوه حفظ تمامیت و زنجیره نگهداری را توضیح میدهد، بدون آنکه از یک مدرک بیش از توانش نتیجه بگیرد.
دفتر باید همراه نمره حرکت کند. داشبوردی که فقط «۸۳ درصد» نشان میدهد و نسخه سؤال، چکیده سامانه، سیاست دسترسی و وضع مواجهه را حذف میکند، عدد را از معنایش جدا کرده است.
یک مجموعه نباید همه نقشها را بازی کند.
| بخش | چه کسی آن را میبیند | مصرف درست | پس از مواجهه چه میشود |
|---|---|---|---|
| تمرین | توسعهدهنده و سامانه | فهم کار، عیبیابی اجرا، ساخت نمونه | برای توسعه مفید میماند؛ شاهد مستقل نیست |
| تنظیم | مالک ارزیابی و توسعهدهنده محدود | تعیین آستانه، اعتبارسنجی داور، برآورد پراکندگی | تصمیمها منجمد و هر مصرف ثبت میشود |
| تصمیم | اجراگر محبوس یا ارزیاب مستقل | انتخاب، انتشار یا ادعای اطمینان | پس از نشت، دامنه درگیر محدود یا بازنشسته میشود |
| نگهبان | فقط امانتدار تا زمان مقرر | کشف رانش و آزمون نسخه آینده | آهسته چرخش میکند؛ پاسخ ریزدانه به توسعه برنمیگردد |
تقسیم عمومی و خصوصی در بنچمارک FACTS Grounding از Google DeepMind نمونه روشن است: ۸۶۰ مورد عمومی و ۸۵۹ مورد نگهداشتهشده بودند و رتبهبندی از هر دو بخش استفاده میکرد. بخش خصوصی چند مسیر را محدود میکند؛ اما بهتنهایی ثبت ارائهدهنده، دسترسی ارزیاب، ماده مشابه یا استفاده دوباره آینده را مهار نمیکند.
نمونه عملیاتی تازه ارزشمند است چون کار محلی را نمایندگی میکند و تاریخ مواجهه کوتاهتری دارد. تازگی همان محرمانگی نیست. سؤال تازهای که در تیکت مشترک، دستور فروشنده یا گزارش با جواب ریزدانه قرار گرفته، پیش از نخستین اجرای رسمی لو رفته است.
درباره عامل، جمله «مدل با پاسخ آموزش ندیده» کافی نیست. سامانه هنگام اجرا شاید جواب را پیدا کند. NIST CAISI نمونههایی دیده که عامل راهنمای حمله را جستوجو کرده، نسخه تازهتر مخزن را خوانده، شرط آزمون را غیرفعال کرده یا مسیر ناخواسته سنجه را به کار گرفته است. درصدهای گزارششده کران پایین مشاهدههای ثبتشدهاند، نه برآورد شیوع در همه عاملها.
پیش از اجرا قرارداد امکانات را بنویسید:
این مرز را بیرون مدل اعمال کنید. اگر کار واقعی به وب نیاز دارد، فقط برای پاکترشدن نمره آن را نبندید؛ پیکره وب منجمد بدهید، مکان پاسخهای شناختهشده را مسدود کنید یا ادعا را «عملکرد با وب باز» بنامید. مقایسه معتبر میان شرایط اعلامشده است، نه امکانات پنهانی متفاوت.
این مسئله با مهار ارزیابی سایبری پیوند دارد اما یکی نیست. محیط محبوس باید هم جهان بیرون را از اجرای خطرناک حفظ کند و هم آزمون را از منابع ناخواسته داخل یا بیرون محفظه.
یک روش واحد، کپی دقیق، بازنویسی، ترجمه، جستوجوی جواب، تنظیم مکرر و بازیدادن سنجه را با هم نمیبیند. چند آزمون با خطاهای متفاوت کنار هم بگذارید:
علامت مثبت نیازمند بررسی است. علامت منفی فقط دامنه همان کشف را تنگ میکند. افت روی نمونه پاک شاید از آلودگی، ضعف پایداری، نمونه خراب یا جابهجایی توزیع بیاید. پیش از نامگذاری علت، سؤالها را داوری کنید.
مالک ارزیابی برای همان ۴۰۰ پرسش دفتر مواجهه را بازسازی میکند:
گروه فقط ۶۰ سؤال را کم نمیکند تا بقیه را بیقید «پاک» بنامد. بازخورد ریزدانه شاید کل پیکربندی را تغییر داده باشد و دسترسی وب جزئی از سامانه آزموده بوده است. چهار کار انجام میدهد:
۱. ۲۰۰ مورد عمومی را عملکرد توسعه مینامد. ۲. ۶۰ مورد افشاشده را برای انتخاب مستقل نامعتبر اعلام میکند. ۳. هر دو نامزد را با پیکره منبع منجمد و قواعد ابزار یکسان روی مجموعه محبوس تازه میسنجد. ۴. ۲۰ نگهبان را فقط بررسی حساسیت میگیرد، نه رتبهبندی دقیق مستقل.
فرض کنید مدل دوم هنوز در فیلد دقیق جلو است، اما در بند بیپشتوانه و امتناع فارسی عقب میماند. حکم اکنون محدود میشود: این مدل میتواند استخراج کمخطر انگلیسی را زیر کنترل استناد پیشنویس کند؛ نمره ۹ امتیازی نخست، ادعای گستردهتر را ثابت نکرده است.
مالک تصمیم باید وضعیت صادر کند، نه صفت مبهم.
| حکم | شرط | مصرف مجاز |
|---|---|---|
| پذیرش | مواجهه برای ادعا مهار شده؛ پیکربندی و سنجه معتبرند؛ محدودیت باقیمانده روشن است | تا رویداد انقضا، تصمیم نامبرده را پشتیبانی میکند |
| محدودکردن | مواجهه یا ابهام کراندار باقی است، اما شاهد سالم ادعای کوچکتری را نگه میدارد | فقط برای برش و مقایسه ثبتشده |
| تکرار | آزمون تازه یا محبوس میتواند ابهام اثرگذار را حل کند | تا رسیدن نتیجه نهایی، مجوز انتشار ندارد |
| کنارگذاری | مواجهه گسترده، تبار گمشده، بازی سنجه یا استقلال بازسازیناپذیر است | فقط نشانه تاریخی توسعه؛ نه شاهد تصمیم جاری |
برش نامعتبر را بیتحلیل ازپیشاعلامشده در میانگین بزرگتر پنهان نکنید. سؤال لورفته را پس از دیدن نتیجه بیصدا عوض نکنید. گزارش اول را نگه دارید، وضعیتش را علامت بزنید و نسخه تازه ارزیابی بسازید.
اگر نمره دروازه تولید است، آن را به واحد تغییر و انتشار تدریجی وصل کنید. مدل، دستور، ابزار، پیکره، داور یا قاعده دسترسی تازه میتواند شاهد را منقضی کند، حتی اگر فایل بنچمارک همان باشد.
دقت لازم است، اما عملیات ارزیابی معیار جدا دارد:
برای صفر نشاندادن رخداد، گزارش را سرکوب نکنید. زمان کشف و سرعت باطلکردن درست را نیز بسنجید. برنامه ارزیابی وقتی قابل اعتمادتر میشود که بتواند نمرهای را منظم پس بگیرد.
پیش از آنکه نمره فروشنده، مدل یا نسخه تولید را عوض کند، بپرسید:
آزمون پنهان لزوماً آزمون خوبی نیست و بنچمارک عمومی نیز بیمصرف نیست. هدف کنترل روشن است: نگذارید مواجهه قبلی به جای تعمیم فروخته شود. نمره فقط وقتی شاهد قابل اعتماد میشود که تاریخ مواجهه، مرز اجرا و عدمقطعیت باقیمانده همراه تصمیم حرکت کنند.

وقتی رخداد نادر است، نرخ خطای پایین هم صفی از هشدارهای اشتباه میسازد. آستانه را با تعداد موارد ازدسترفته، سهم هشدارهای درست و ظرفیت بررسی انتخاب کنید.
ادامه مطلب
راهنمای عملی برای تعریف فرد محافظتشده، محدودکردن سهمها، حسابکردن انتشارهای پیاپی، سنجش فایده و تصمیم درباره انتشار یک خروجی با ادعای حریم خصوصی تفاضلی.
ادامه مطلب
حلقه عامل، هماهنگسازی گراف، اصلاح محدود، دروازه مبتنی بر شاهد و تأیید انسانی را در یک معماری آزمونپذیر کنار هم بگذارید.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.