نمرهٔ آزمون وقتی اعتبار دارد که مسیر مواجهه با سؤال‌ها روشن باشد

ت

تیم ژرف

۱۱ شهریور ۱۴۰۵۱۴ دقیقه مطالعه
نمرهٔ آزمون وقتی اعتبار دارد که مسیر مواجهه با سؤال‌ها روشن باشد

فرض کنید گروه خرید دو دستیار را با ۴۰۰ پرسش قرارداد می‌سنجد. مدل دوم ۹ امتیاز جلو می‌افتد و آماده انتخاب می‌شود. بعد یکی از مهندسان می‌بیند ۶۰ پرسش از مخزنی عمومی آمده که برای تنظیم دستور استفاده شده، عامل هنگام اجرا به صفحه‌های پاسخ دسترسی وب داشته و همان پرسش‌ها در گزارش هفتگی با هر دو فروشنده به اشتراک گذاشته شده است.

حساب نمره درست است؛ شاهد تصمیم نه.

اکنون پرسش واقعی این است: آیا این نمره هنوز می‌تواند انتخاب مدل یا مجوز انتشار را پشتیبانی کند، یا باید محدود، روی آزمونی محبوس تکرار، یا کنار گذاشته شود؟ پاسخ به دفتر مواجهه آزمون نیاز دارد، نه ادعای مطمئن «پاک‌بودن» بنچمارک.

نمره تکرارپذیر هم ممکن است پرسش اشتباه را پاسخ دهد

هر نتیجه ارزیابی دست‌کم چهار چیز را به هم وصل می‌کند: سامانه هوش مصنوعی با پیکربندی معین، مجموعه کارها، محیط اجرا و سنجه. آلودگی زمانی رخ می‌دهد که دیدن سؤال، جواب، نمونه نزدیک یا منبعی که راه‌حل را می‌سازد، معنای نتیجه را تغییر دهد. به‌جای سنجش کار نادیده، آزمون شاید بخشی از حفظ‌کردن، تنظیم قبلی، مهارت بازیابی یا شناخت داور را اندازه بگیرد.

هر مواجهه‌ای تخلف نیست. نمونه عمومی برای آموزش تیم، عیب‌یابی و مقایسه مفید است. خطا زمانی آغاز می‌شود که همان مجموعه آشنا را شاهدی مستقل معرفی کنیم. پرسشی که با آن دستور را اصلاح کرده‌ایم می‌تواند آزمون بازگشت همان اصلاح بماند؛ اما دیگر ثابت نمی‌کند دستور تازه روی کار ندیده نیز تعمیم می‌یابد.

راهنمای ارزیابی مدل‌های مرزی سبد کامل‌تری از سنجش را شرح می‌دهد. اینجا تصمیم محدودتر است: با توجه به کل مسیر مواجهه، یک نمره چه اعتباری دارد؟

منابع معتبر چه چیزی را تثبیت می‌کنند

منابع اصلی تازه، مسئله‌ای مشترک را از چند زاویه نشان می‌دهند.

برنامه تازه ارزیابی فناوری هوش مصنوعی NIST می‌گوید در مرحله اولیه از داده کور و محیط محبوس استفاده می‌کند تا خطر آمیختن آموزش و آزمون کم شود. ارائه‌دهنده داده، مجموعه اصلی را از دسترس ارائه‌دهنده مدل دور نگه می‌دارد و مدل‌ها با کار و سنجه مشترک ارزیابی می‌شوند. این برنامه در حال توسعه NIST است، نه گواهی آماده برای ارزیابی داخلی هر سازمان.

Google DeepMind در مطلب ۲۷ اوت ۲۰۲۶ درباره آزمایش ارزیابی دوسوکور محیطی با حفاظت رمزنگاری را توصیف می‌کند که هم پرسش محرمانه ارزیاب را از مالک مدل پنهان نگه می‌دارد و هم وزن اختصاصی مدل را از ارزیاب. گوگل آن را نخستین ارزیابی دوسوکور یک مدل مرزی اختصاصی می‌نامد. این توصیف خود گوگل از آزمایش است و ثابت نمی‌کند هر بنچمارک محرمانه دقیقاً به همین زیرساخت نیاز دارد.

راهنمای ۲۹ مه ۲۰۲۶ OpenAI برای ارزیابی شخص ثالث قابل اعتماد میان ادعای آزمون و شاهد اعتبار نتیجه فرق می‌گذارد. آلودگی را کنار دستکاری پاداش، امتناع، سؤال خراب و کم‌کاری عمدی می‌گذارد و یادآور می‌شود سؤال یا جواب شاید در داده آموزش باشد یا عامل از راه مرور وب آن را پیدا کند.

تحلیل NIST CAISI از تقلب در ارزیابی عامل‌ها مرز دیگری می‌گذارد: در آلودگی راه‌حل، سامانه نادرست به اطلاعات پاسخ می‌رسد؛ در بازی‌دادن سنجه، از شکاف داوری عبور می‌کند بی‌آنکه مقصود کار را انجام دهد. هر دو می‌توانند قبولی بسازند بی‌آنکه ادعای اصلی را پشتیبانی کنند.

اینها یافته‌های منبع‌اند. دفتر مواجهه، چهار حکم نتیجه و دروازه انتشار در ادامه، جمع‌بندی عملی ژرف است.

پنج مسیر مواجهه را رسم کنید

وجود فایل دقیق آزمون در داده پیش‌آموزش فقط آشکارترین راه است. پنج لایه را جدا ببینید:

۱. مواجهه مدل: سؤال، جواب، معیار داوری یا نمونه نزدیک وارد پیش‌آموزش، تنظیم، داده ترجیح، تقطیر، تولید داده مصنوعی یا آموزش ایمنی می‌شود. ۲. مواجهه توسعه: افراد با اقلام تصمیم، دستور، آستانه، بازیابی، ابزار، نسخه مدل یا شرط توقف را انتخاب می‌کنند. بازخورد پیاپی جدول رتبه‌بندی حتی بدون تغییر وزن، نقش سرپرستی دارد. ۳. مواجهه زمینه: سؤال یا پاسخ در دستور سامانه، نمونه ورودی، حافظه، کش، پیکره بازیابی، داده آزمایشی یا یادداشت ارزیابِ در دسترس اجرا قرار می‌گیرد. ۴. مواجهه ابزار: عامل از جست‌وجوی وب، تاریخچه بسته، نسخه تازه‌تر مخزن، خدمت پاسخ، عامل دیگر یا فضای کاری مشترک به راه‌حل می‌رسد. ۵. مواجهه سنجه: سامانه می‌آموزد بدون انجام کار موردنظر، شرط قبولی را برآورده کند؛ آزمون را تغییر دهد، سبک داور را هدف بگیرد، از خطای تجزیه‌گر بهره ببرد یا حالت مخصوص همان سؤال بسازد.

این مسیرها را به شکل یال میان بازیگر و دارایی ثبت کنید. «توسعه‌دهنده فایل جواب را باز نکرده» دفاع ضعیفی است اگر بهینه‌ساز دستور، نمره تک‌تک سؤال‌ها را گرفته یا مرورگر عامل به راهنمای حل رسیده باشد.

قول آزمون کاملاً پاک ندهید

اثبات نبودن مواجهه دشوار است؛ به‌خصوص وقتی پیکره آموزش مدل بسته در دسترس نیست. حتی با دسترسی به داده آموزش، تطبیق ظاهری محدودیت دارد. گزارش فنی GPT-4 روش تطبیق زیررشته را توضیح می‌دهد که نمونه‌های منطبق را حذف و نمره را دوباره محاسبه کرده است. همان گزارش احتمال منفی کاذب بر اثر تفاوت کوچک و مثبت کاذب بر اثر تطبیق ناقص را صریح می‌گوید و توضیح می‌دهد داده کوچک‌تر پس‌آموزش به‌طور جداگانه بررسی نشده است.

مواجهه معنایی می‌تواند از نمایش دیگری عبور کند. مقاله اصلی EMNLP 2024 با عنوان آلودگی داده می‌تواند از مرز زبان بگذرد، مدل‌های باز را عمداً با ترجمه مجموعه آزمون آموزش داد. عملکرد روی آزمون انگلیسی اصلی بالا رفت، در حالی که چند روش مبتنی بر حفظ‌کردن نتوانستند مواجهه تزریق‌شده را بیابند. این آزمایش کنترل‌شده نمی‌گوید مدل تجاری معینی آلوده است؛ نشان می‌دهد «نبود تطبیق متن انگلیسی» مساوی «نبود مواجهه» نیست.

جمله قابل دفاع محدود است: کدام مسیر بررسی شد، چه شاهدی در دست بود، چه آزمونی اجرا شد و چه چیز نامعلوم ماند. از وضعیت‌هایی مانند در کنترل‌های اعلام‌شده مواجهه شناخته‌شده ندارد، مواجهه مشکوک یا مواجهه نامعلوم استفاده کنید. جست‌وجوی هش را به گواهی تبدیل نکنید.

برای هر ارزیابی دفتر مواجهه بسازید

پیش از نخستین اجرا، رکورد را باز کنید. حداقل این موارد لازم‌اند:

شناسه ارزیابی
ادعای تصمیم
نسخه کار و چکیده اقلام
منبع، تاریخ ساخت و مجوز هر قلم
طبقه محرمانگی و افراد مجاز
بخش تمرین، تنظیم، تصمیم یا نگهبان
چکیده پیکربندی مدل و سامانه
ابزار، دامنه، مخزن، داده و برش زمانی مجاز
نسخه سنجه، معیار و داور
اجرای پیشین و گیرنده بازخورد ریزدانه
بررسی هم‌پوشانی، بازتولید و تعمیم
رویداد مواجهه قطعی، مشکوک و نامعلوم
وضعیت نتیجه، مالک و شرط انقضا

این دفتر را به خروجی خام، رد ابزارهای مشاهده‌پذیر، فایل داوری، حذف‌ها و گزارش نهایی ببندید. راهنمای شاهد حسابرسی هوش مصنوعی شیوه حفظ تمامیت و زنجیره نگهداری را توضیح می‌دهد، بدون آنکه از یک مدرک بیش از توانش نتیجه بگیرد.

دفتر باید همراه نمره حرکت کند. داشبوردی که فقط «۸۳ درصد» نشان می‌دهد و نسخه سؤال، چکیده سامانه، سیاست دسترسی و وضع مواجهه را حذف می‌کند، عدد را از معنایش جدا کرده است.

تمرین، تنظیم و شاهد تصمیم را از هم جدا کنید

یک مجموعه نباید همه نقش‌ها را بازی کند.

بخشچه کسی آن را می‌بیندمصرف درستپس از مواجهه چه می‌شود
تمرینتوسعه‌دهنده و سامانهفهم کار، عیب‌یابی اجرا، ساخت نمونهبرای توسعه مفید می‌ماند؛ شاهد مستقل نیست
تنظیممالک ارزیابی و توسعه‌دهنده محدودتعیین آستانه، اعتبارسنجی داور، برآورد پراکندگیتصمیم‌ها منجمد و هر مصرف ثبت می‌شود
تصمیماجراگر محبوس یا ارزیاب مستقلانتخاب، انتشار یا ادعای اطمینانپس از نشت، دامنه درگیر محدود یا بازنشسته می‌شود
نگهبانفقط امانت‌دار تا زمان مقررکشف رانش و آزمون نسخه آیندهآهسته چرخش می‌کند؛ پاسخ ریزدانه به توسعه برنمی‌گردد

تقسیم عمومی و خصوصی در بنچمارک FACTS Grounding از Google DeepMind نمونه روشن است: ۸۶۰ مورد عمومی و ۸۵۹ مورد نگه‌داشته‌شده بودند و رتبه‌بندی از هر دو بخش استفاده می‌کرد. بخش خصوصی چند مسیر را محدود می‌کند؛ اما به‌تنهایی ثبت ارائه‌دهنده، دسترسی ارزیاب، ماده مشابه یا استفاده دوباره آینده را مهار نمی‌کند.

نمونه عملیاتی تازه ارزشمند است چون کار محلی را نمایندگی می‌کند و تاریخ مواجهه کوتاه‌تری دارد. تازگی همان محرمانگی نیست. سؤال تازه‌ای که در تیکت مشترک، دستور فروشنده یا گزارش با جواب ریزدانه قرار گرفته، پیش از نخستین اجرای رسمی لو رفته است.

سامانه ابزارمند را داخل مرز آزمون بگذارید

درباره عامل، جمله «مدل با پاسخ آموزش ندیده» کافی نیست. سامانه هنگام اجرا شاید جواب را پیدا کند. NIST CAISI نمونه‌هایی دیده که عامل راهنمای حمله را جست‌وجو کرده، نسخه تازه‌تر مخزن را خوانده، شرط آزمون را غیرفعال کرده یا مسیر ناخواسته سنجه را به کار گرفته است. درصدهای گزارش‌شده کران پایین مشاهده‌های ثبت‌شده‌اند، نه برآورد شیوع در همه عامل‌ها.

پیش از اجرا قرارداد امکانات را بنویسید:

  • مقصد شبکه و آخرین زمان مجاز داده؛
  • نسخه منجمد مخزن، آینه بسته، پایگاه دانش و تصویر سیستم‌عامل؛
  • مجوز خواندن و نوشتن برای هر مسیر و ابزار؛
  • حکم همکاری، حافظه، کش و مدل بیرونی؛
  • فایل سنجه و آزمونی که نامزد حق دیدن دارد؛
  • بودجه توکن، زمان، تلاش دوباره، شاخه و ابزار؛
  • فیلدهای ردی که بدون آنها نتیجه شمرده نمی‌شود.

این مرز را بیرون مدل اعمال کنید. اگر کار واقعی به وب نیاز دارد، فقط برای پاک‌ترشدن نمره آن را نبندید؛ پیکره وب منجمد بدهید، مکان پاسخ‌های شناخته‌شده را مسدود کنید یا ادعا را «عملکرد با وب باز» بنامید. مقایسه معتبر میان شرایط اعلام‌شده است، نه امکانات پنهانی متفاوت.

این مسئله با مهار ارزیابی سایبری پیوند دارد اما یکی نیست. محیط محبوس باید هم جهان بیرون را از اجرای خطرناک حفظ کند و هم آزمون را از منابع ناخواسته داخل یا بیرون محفظه.

کشف آلودگی ابزار تشخیص است، نه برگه برائت

یک روش واحد، کپی دقیق، بازنویسی، ترجمه، جست‌وجوی جواب، تنظیم مکرر و بازی‌دادن سنجه را با هم نمی‌بیند. چند آزمون با خطاهای متفاوت کنار هم بگذارید:

  • در حد مجاز، هش، زیررشته بلند، همسایه معنایی، نشانی منبع، تاریخچه کد و ترجمه را مقایسه کنید؛
  • پیش از حل ببینید مدل حواس‌پرت‌کن نامعمول، ترتیب، غلط تایپی، فراداده یا عبارت پاسخ را بازتولید می‌کند یا نه؛
  • نمونه هم‌ساخت بسازید که همان مهارت را بخواهد اما سطح حفظ‌شده را بشکند؛
  • بخش عمومی، خصوصی، تازه و محلی را با بازه عدم‌قطعیت مقایسه کنید؛
  • رد ابزار و حالت نهایی را برای جست‌وجوی پاسخ یا دستکاری سنجه بخوانید؛
  • چند سؤال نگهبان با تاریخ مواجهه سخت‌گیرانه نگه دارید؛
  • اگر شک تصمیم را عوض می‌کند، روی مجموعه تازه و محبوس تکرار کنید.

علامت مثبت نیازمند بررسی است. علامت منفی فقط دامنه همان کشف را تنگ می‌کند. افت روی نمونه پاک شاید از آلودگی، ضعف پایداری، نمونه خراب یا جابه‌جایی توزیع بیاید. پیش از نام‌گذاری علت، سؤال‌ها را داوری کنید.

مثال دستیار قرارداد را از دروازه عبور دهید

مالک ارزیابی برای همان ۴۰۰ پرسش دفتر مواجهه را بازسازی می‌کند:

  • ۲۰۰ پرسش عمومی برای تنظیم دستور و بازیابی مصرف شده؛
  • ۱۲۰ پرسش تصمیم خصوصی از قراردادهای پس از برش زمانی اعلام‌شده مدل آمده؛
  • ۶۰ مورد از این بخش در گزارش هفتگی همراه جواب ریزدانه افشا شده؛
  • ۲۰ پرسش نگهبان تازه فقط نزد اجراگر محبوس مانده؛
  • عامل وب نامحدود داشته و بند منبع ۱۴ سؤال قابل جست‌وجو بوده؛
  • سنجه، فیلد استخراج‌شده، استناد، امتناع و یک قاعده قطعی قرارداد را بررسی کرده است.

گروه فقط ۶۰ سؤال را کم نمی‌کند تا بقیه را بی‌قید «پاک» بنامد. بازخورد ریزدانه شاید کل پیکربندی را تغییر داده باشد و دسترسی وب جزئی از سامانه آزموده بوده است. چهار کار انجام می‌دهد:

۱. ۲۰۰ مورد عمومی را عملکرد توسعه می‌نامد. ۲. ۶۰ مورد افشاشده را برای انتخاب مستقل نامعتبر اعلام می‌کند. ۳. هر دو نامزد را با پیکره منبع منجمد و قواعد ابزار یکسان روی مجموعه محبوس تازه می‌سنجد. ۴. ۲۰ نگهبان را فقط بررسی حساسیت می‌گیرد، نه رتبه‌بندی دقیق مستقل.

فرض کنید مدل دوم هنوز در فیلد دقیق جلو است، اما در بند بی‌پشتوانه و امتناع فارسی عقب می‌ماند. حکم اکنون محدود می‌شود: این مدل می‌تواند استخراج کم‌خطر انگلیسی را زیر کنترل استناد پیش‌نویس کند؛ نمره ۹ امتیازی نخست، ادعای گسترده‌تر را ثابت نکرده است.

یکی از چهار حکم را به نتیجه بدهید

مالک تصمیم باید وضعیت صادر کند، نه صفت مبهم.

حکمشرطمصرف مجاز
پذیرشمواجهه برای ادعا مهار شده؛ پیکربندی و سنجه معتبرند؛ محدودیت باقیمانده روشن استتا رویداد انقضا، تصمیم نام‌برده را پشتیبانی می‌کند
محدودکردنمواجهه یا ابهام کران‌دار باقی است، اما شاهد سالم ادعای کوچک‌تری را نگه می‌داردفقط برای برش و مقایسه ثبت‌شده
تکرارآزمون تازه یا محبوس می‌تواند ابهام اثرگذار را حل کندتا رسیدن نتیجه نهایی، مجوز انتشار ندارد
کنارگذاریمواجهه گسترده، تبار گمشده، بازی سنجه یا استقلال بازسازی‌ناپذیر استفقط نشانه تاریخی توسعه؛ نه شاهد تصمیم جاری

برش نامعتبر را بی‌تحلیل ازپیش‌اعلام‌شده در میانگین بزرگ‌تر پنهان نکنید. سؤال لو‌رفته را پس از دیدن نتیجه بی‌صدا عوض نکنید. گزارش اول را نگه دارید، وضعیتش را علامت بزنید و نسخه تازه ارزیابی بسازید.

اگر نمره دروازه تولید است، آن را به واحد تغییر و انتشار تدریجی وصل کنید. مدل، دستور، ابزار، پیکره، داور یا قاعده دسترسی تازه می‌تواند شاهد را منقضی کند، حتی اگر فایل بنچمارک همان باشد.

استقلال شاهد را هم اندازه بگیرید

دقت لازم است، اما عملیات ارزیابی معیار جدا دارد:

  • پوشش دفتر: سهم اقلام تصمیم دارای منبع، بخش، چکیده، امانت‌دار و وضع مواجهه؛
  • پوشش سیاست دسترسی: یال‌های لازم که واقعاً اعمال و ثبت شده‌اند؛
  • شکاف عمومی و خصوصی: اختلاف عملکرد با عدم‌قطعیت و برش کار همسان؛
  • شکاف نمونه هم‌ساخت: تغییر عملکرد بر دگرگونی حافظ مهارت، همراه بررسی نوع سؤال؛
  • رخداد مواجهه: سؤال، جواب، معیار یا نمره‌ای که از مخاطب مجاز بیرون رفته؛
  • نرخ اجرای باطل‌شده: اجرایی که بعداً روشن شده ادعایش را پشتیبانی نمی‌کند؛
  • بودجه بازخورد: شمار و ریزدانگی سیگنال بخش تصمیم که به توسعه برگشته؛
  • سن بخش تصمیم: زمان ساخت، نخستین مواجهه و آخرین مصرف مستقل؛
  • تأخیر تکرار: فاصله شک اثرگذار تا نتیجه نهایی آزمون محبوس.

برای صفر نشان‌دادن رخداد، گزارش را سرکوب نکنید. زمان کشف و سرعت باطل‌کردن درست را نیز بسنجید. برنامه ارزیابی وقتی قابل اعتمادتر می‌شود که بتواند نمره‌ای را منظم پس بگیرد.

بازبینی پیش از انتشار

پیش از آنکه نمره فروشنده، مدل یا نسخه تولید را عوض کند، بپرسید:

  • این نتیجه دقیقاً کدام ادعا را پشتیبانی می‌کند؟
  • کدام بخش سامانه ممکن است سؤال، جواب، نمونه نزدیک، معیار یا منبع حل را دیده باشد؟
  • کدام قلم توسعه را شکل داده و کدام مستقل مانده است؟
  • آیا مدل، انسان، ابزار، ثبت ارائه‌دهنده، کش و سنجه همه در نقشه‌اند؟
  • بررسی هم‌پوشانی و رفتار چه یافت و چه چیزی را اصولاً نمی‌بیند؟
  • محیط ابزار واقع‌بینانه است و هرجا مقایسه لازم است یکسان مانده؟
  • آیا بازبین هر حذف و تغییر وضعیت را بازسازی می‌کند؟
  • چه رویدادی این نتیجه را منقضی می‌کند؟
  • حکم درست پذیرش، محدودکردن، تکرار یا کنارگذاری است؟

آزمون پنهان لزوماً آزمون خوبی نیست و بنچمارک عمومی نیز بی‌مصرف نیست. هدف کنترل روشن است: نگذارید مواجهه قبلی به جای تعمیم فروخته شود. نمره فقط وقتی شاهد قابل اعتماد می‌شود که تاریخ مواجهه، مرز اجرا و عدم‌قطعیت باقی‌مانده همراه تصمیم حرکت کنند.

یادداشت منابع — بازبینی ۲ سپتامبر ۲۰۲۶

#ارزیابی هوش مصنوعی#آلودگی بنچمارک#داده آزمون#حاکمیت مدل#اطمینان هوش مصنوعی

مطالب مرتبط

یک فرایند را برای کشف نیاز مشخص کنید

اگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.