
دیوار بازخورد: نگذارید خروجی هوش مصنوعی به داده مرجع تبدیل شود
معماری کنترلی عملی برای جداسازی شواهد مستقل، تصمیمهای متأثر از مدل، محتوای مصنوعی و بازخورد تولید پیش از آنکه مدل بعدی از آنها یاد بگیرد.
ادامه مطلبتیم ژرف ایآی

یک دستیار تدارکات، صورتحساب را میخواند، یک سفارش خرید ظاهراً مرتبط پیدا میکند و پیشنویس تأیید را میسازد. نام تأمینکننده و مبلغ برابرند، اما واحد پول مشخص نیست و دو سفارش، بخشی یکسان از شماره مرجع را دارند. مدل همچنان میتواند پاسخی روان بنویسد. پرسش مفید این است که آیا سامانه باید اجازه دهد آن پاسخ به تصمیم تبدیل شود یا نه.
تصمیم خواننده در این راهنما روشن است: برای این ادعا یا اقدام، هوش مصنوعی باید پاسخ دهد، شاهد بیشتری بجوید، پرونده را به بازبین صلاحیتدار ارجاع دهد یا امتناع کند؟ یک نشان عمومی «اطمینان» یا جملهای در پرامپت که میگوید «اگر نمیدانی بگو نمیدانم» این تصمیم را حل نمیکند. به قراردادی عملیاتی نیاز است که شاهد، پیامد، عملکرد اندازهگیریشده و ظرفیت مسیر جایگزین را به هم متصل کند.
قاعده مرکزی چنین است: خودداری، تصمیم سامانه است؛ نه سبک متن تولیدشده. امتیاز پایین فقط یک نشانه است. نتیجه باید بیرون مدل تعیین و روی پروندههای نماینده آزمایش شود؛ تغییر مدل، کار، جمعیت، شاهد یا هزینه خطا آن را بیاعتبار میکند.
مدل میتواند پیش از یک پاسخ غلط بنویسد «مطمئن نیستم» یا پاسخ نادرست را با قاطعیت کامل بیان کند. ممکن است به دلیل سیاست از درخواستی بیخطر امتناع کند و همزمان واقعیتی ساختگی درباره یک سند بسازد. این سازوکارها یکی نیستند:
همه را زیر برچسب «شکست» نگذارید. هر وضعیت به کد دلیل، پیام کاربر، گام امن بعدی، مالک و معیار مستقل نیاز دارد. نگهداشتن پاسخ و رهاکردن بیصدای کار، شکست ایمن نیست؛ انتقال شکست به پاییندست است.
به همین دلیل طراحی تأیید انسانی اهمیت دارد. ارجاع زمانی ارزش دارد که شخص، شاهد، ابهام، پیامد و گزینههای موجود را ببیند و برای تصمیمگیری هم اختیار کافی داشته باشد و هم زمان کافی.
هسته چارچوب مدیریت ریسک هوش مصنوعی NIST میگوید مرز دانش و شیوه نظارت انسانی باید مستند شوند، ارزیابی به شرایط استقرار شباهت داشته باشد، محدودیت تعمیم ثبت شود و سامانه وقتی فراتر از مرز دانشش کار میکند بتواند ایمن متوقف شود. این چارچوب یک آستانه عمومی برای اطمینان ارائه نمیکند.
برای سامانههای مولد، NIST AI 600-1 که در ژوئیه ۲۰۲۴ منتشر شده، «برساخت نادرست» را محتوای غلطی تعریف میکند که با اطمینان عرضه میشود و اعتبارسنجی تجربی ادعاهای توانمندی، بررسی منبع و استناد و رسیدگی به خطا را پیشنهاد میدهد. بنابراین روانی متن نمیتواند نشانه درستی باشد.
پژوهش، ابزارهای محدودتری فراهم کرده است. مقاله طبقهبندی گزینشی سال ۲۰۱۷ گزینه رد را بهصورت مبادله میان پوشش—سهم پروندههایی که پاسخ میگیرند—و ریسک در زیرمجموعه پاسخدادهشده صورتبندی میکند. مقاله SelectiveNet در سال ۲۰۱۹ پیشبینی و رد را با هم آموزش میدهد و در مجموعهدادههای طبقهبندی و رگرسیون خود، بهبود مبادله ریسک–پوشش را گزارش میکند. این یافتهها به محیط مطالعه محدودند و برای گردشکار زبانی ضمانت عمومی نیستند.
تحلیل ژرف این است که همین ایده به قرارداد سطح کاربرد تبدیل شود. واحد تصمیم «کل گفتوگو» نیست؛ یک ادعای نوعدار، توصیه، استخراج یا اقدام مشخص است که پیامد و نیاز شاهد آن نامگذاری شده باشد.
از نتیجههایی آغاز کنید که محصول واقعاً میتواند اجرا کند:
| سرنوشت | زمان کاربرد | رفتار لازم |
|---|---|---|
| پاسخ | شاهد و شایستگی ارزیابیشده، قرارداد را برآورده میکنند | نتیجه را همراه با منشأ، دامنه و نسخه برگردانید |
| جستوجوی شاهد | یک واقعیت محدود و گمشده میتواند صلاحیت را عوض کند | منبع مصوب را بازیابی کنید یا یک پرسش دقیق بپرسید، سپس دوباره بسنجید |
| ارجاع | شخص صلاحیتدار یا فرایند قطعی باید استثنا را قضاوت کند | بسته کامل بازبینی بسازید، در صف بگذارید و مهلت خدمت را حفظ کنید |
| امتناع | استفاده ممنوع، ناایمن یا از نظر قانونی پشتیبانیناپذیر است | اقدام را متوقف کنید، مرز مربوط را توضیح دهید و فقط جایگزین امن عرضه کنید |
سرنوشتها را برای هر نوع ادعا جدا تعریف کنید. یک دستیار میتواند زمان دریافت صورتحساب را پاسخ دهد، برای واحد پول شاهد بخواهد، استثنای مبلغ را ارجاع دهد و از ساخت سابقه تأیید جعلی امتناع کند.
حداقل قرارداد باید شامل کار و جمعیت، شاهد الزامی، خطای پذیرفتنی متناسب با پیامد، اختیار پاسخ، مقصد ارجاع، بیشینه زمان انتظار، مرز حریم خصوصی، تاریخ انقضا و مالک باشد. اگر مسیر جایگزین امنی وجود ندارد، کاهش پوشش خودبهخود ایمن نیست؛ شاید محصول اساساً برای آن استفاده مناسب نباشد.
امتیاز مفید پروندهها را طوری مرتب میکند که خطاها بیشتر در یک سوی طیف جمع شوند. احتمال کالیبره ادعای قویتری دارد: میان پروندههای قابلمقایسه که امتیاز ۰٫۸ میگیرند، در شرایط ارزیابیشده تقریباً ۸۰ درصد باید درست باشند. رتبهبندی و کالیبراسیون یک چیز نیستند.
مطالعه کالیبراسیون گوئو و همکاران در سال ۲۰۱۷ در طبقهبندهای عصبی مدرن مورد آزمایش، کالیبراسیون ضعیف یافت و نشان داد مقیاسگذاری دما در بسیاری از همان محیطها بهبود ایجاد میکند. این پژوهش ثابت نکرد که یک روش کالیبراسیون، احتمال توکن، عبارت اطمینان مدل یا امتیاز فروشنده را به احتمال عمومی صحت یک ادعا تبدیل میکند.
برای گردشکار مولد، نشانهها را پیرامون خود تصمیم بسازید:
نشانههای نامرتبط را در یک عدد سبز میانگین نگیرید. امضای معتبر جای شاهد گمشده را پر نمیکند و شباهت معنایی مجوز مستأجر را کنار نمیزند. حق وتو، الزام و رتبهبندی باید جدا بمانند.
پوشش، سهم پروندههای واجد شرایطی است که سامانه خودکار پاسخ میدهد. ریسک گزینشی، خطا یا زیان در همان زیرمجموعه پاسخدادهشده است. با سختترشدن آستانه پاسخ، پوشش معمولاً کم میشود و ریسک اندازهگیریشده شاید پایین بیاید؛ اما کار ردشده ناپدید نمیشود.
برای هر آستانه این موارد را گزارش کنید:
هدف، زیان مورد انتظار و هزینه خدمت در همه سرنوشتهاست؛ نه کمترین خطا یا بیشترین خودکارسازی. آستانهای که خطا را نصف میکند اما ۴۰ درصد ترافیک را به تیمی با ظرفیت ۵ درصد میفرستد، صف و تأیید مکانیکی میسازد و شاید از قراردادی محدودتر بدتر باشد.
یک ماشین حالت صریح بسازید:
۱. تصمیم را طبقهبندی کنید. نوع ادعا، پیامد، طرف متاثر، اختیار لازم و مهلت را مشخص کنید. ۲. شاهد را گرد آورید. فقط منابع مصوب را بازیابی و نسخه، تاریخ، دامنه دسترسی و تعارض را ثبت کنید. ۳. دروازههای قطعی را اجرا کنید. فیلد الزامی، مجوز، سیاست، محاسبه، ناوردا و استفاده ممنوع را بسنجید. ۴. نشانههای اعتبارسنجیشده را محاسبه کنید. فقط امتیازهایی را به کار برید که کار، جمعیت، نسخه و سابقه کالیبراسیونشان روشن است. ۵. سرنوشت را انتخاب کنید. نخست حق وتو، سپس قاعده جستوجوی شاهد، آستانه ویژه پیامد و ظرفیت مسیر جایگزین را اعمال کنید. ۶. ایمن اجرا کنید. با منشأ پاسخ دهید، یک پرسش محدود بپرسید، بسته بازبینی بسازید یا بدون انجام اثر جانبی امتناع کنید. ۷. شرط پس از اجرا را تأیید کنید. تحویل، ورود به صف، رد یا ثبت نهایی را بررسی و دلیل و شاهد را نگهداری کنید.
پرامپت میتواند پیام را بنویسد، اما نباید آستانه را عوض کند، کد دلیل بسازد، مسیر ممنوع را باز کند یا پاسخ خود را «تأییدشده» بنامد. نسخه سیاست و شاهد را در رویداد ممیزی نگه دارید.
مجموعه آزمون عادی، پاسخگویی را بیش از حد پاداش میدهد؛ چون اغلب هر نمونه یک برچسب یا پاسخ مورد انتظار دارد. مقاله SQuAD 2.0 این ضعف را برای پرسشپاسخ استخراجی با افزودن بیش از ۵۰ هزار پرسش بیپاسخ اما شبیه پرسشهای پاسخپذیر آشکار کرد. درس آن گستردهتر اما محدود است: ارزیابی باید پروندههای باورپذیری داشته باشد که رفتار درست در آنها استخراج پاسخ نیست.
برای گردشکار واقعی، خانوادههای منفی و مرزی بسازید:
پروندههای چندزبانه و تغییر توزیع را هم وارد کنید. بسنجید آیا خودداری فراتر از مثالهایی که آن را آموزش دادهاند تعمیم مییابد یا نه. راهنمای ارزیابی مدلهای مرزی توضیح میدهد چرا معیار فروشنده باید با شاهد مخصوص کاربرد و آگاه از شکست جایگزین شود.
روشهای همریخت میتوانند مجموعه پیشبینی بسازند یا تصمیم را با ضمانت نمونه محدود و تحت فرضهای روشن تنظیم کنند. مقاله سال ۲۰۲۴ گوگل درباره کنترل ریسک همریخت پیشبینی همریخت را برای کنترل مقدار مورد انتظار تابع زیان یکنوا بسط میدهد و نمونههایی در بینایی ماشین و پردازش زبان طبیعی نشان میدهد.
این دستاورد، گواهی موردبهمورد درستی یک پاراگراف نیست. ضمانت به زیان، داده کالیبراسیون، قابلیت جابهجایی یا فرضهای اعلامشده، اندازه نمونه و پیادهسازی وابسته است. پوشش حاشیهای میتواند عملکرد بد گروهی کوچک و پرخطر را پنهان کند؛ تغییر توزیع، پرسوجوی سازگارشونده یا استفاده دوباره از داده کالیبراسیون نیز ادعا را میشکند.
کنترل آماری را جایی به کار ببرید که خروجی و زیان قابلتعریفاند: مجموعه طبقهبندی، فیلد استخراجی، ادعای محدود بازیابی یا امتیاز ریسک کالیبره. ضمانت را کنار فرض، برش، نسخه و انقضا نگه دارید. برای متن آزاد، ادعا را خرد کنید، شاهد و خروجی را محدود و بازبینی انسانی هدفمند بسازید؛ برچسب ریاضی را به کل پاراگراف نچسبانید.
دستیاری را در نظر بگیرید که پیشنهاد میدهد صورتحساب با سفارش خرید مصوب تطبیق دارد یا نه. قرارداد پاسخ خودکار فقط یک واحد پول، یک شخصیت حقوقی، هویت دقیق تأمینکننده، مبلغ در دامنه تحمل مستند، سفارش منقضینشده و نبود نشانه صورتحساب تکراری را پوشش میدهد. ثبت نهایی همچنان در خدمت حسابداری کنترلشده انجام میشود.
برای یک صورتحساب فارسی، OCR مبلغ و تأمینکننده را استخراج میکند اما واحد پول را حل نمیکند. بازیابی، دو سفارش باز با شمارههای شبیه پیدا میکند. امتیاز تطبیق مطلوب مدل بالاست؛ چون نام و مبلغ همخوانی دارند. دروازه قطعی همچنان دو الزام مفقود میبیند: هویت یکتای سفارش و واحد پول.
سامانه جستوجوی شاهد را انتخاب میکند. با شناسه تأمینکننده از دفتر مصوب فروشنده و رکورد سفارش خرید پرسوجو میکند، نه از وب عمومی. اگر یک سفارش و واحد پول روشن شوند، تطبیق را دوباره محاسبه میکند و شاید پاسخ دهد. اگر ابهام بماند، پرونده را ارجاع میدهد و اصل صورتحساب، هر دو سفارش نامزد، فیلدهای استخراجشده، دروازههای شکستخورده، نسخه مدل و مهلت را برای حسابدار میفرستد. اگر درخواستکننده بخواهد واحد پول گمشده ساخته شود، سامانه امتناع میکند. هیچ توضیح تولیدشدهای نمیتواند این حالتها را کنار بزند.
این مثال به کیفیت دانش بازیابی هم وابسته است: خودداری هرگز بهتر از توان سامانه برای تشخیص شاهد معتبر، تازه و کنترلشده از نظر دسترسی نخواهد بود.
برای هر ارجاع، گیرنده، صف، سطح خدمت، بسته شاهد، گزینه تصمیم و مسیر تداوم را نامگذاری کنید. بار بازبین را محدود و از پاسخ و ارجاع نمونهگیری کنید تا بازی با آستانه و سوگیری خودکارسازی آشکار شود.
اصول شفافیت برای ابزارهای پزشکی مجهز به یادگیری ماشین که بهطور مشترک توسط FDA، Health Canada و MHRA منتشر شدهاند، خاص حوزه پزشکیاند و قاعده حقوقی عمومی نیستند. درس طراحی قابلانتقال آنها این است که استفاده موردنظر، نقش در گردشکار، عملکرد، محدودیت شناختهشده، فاصله اطمینان، شکاف داده و شرایط ناسازگار با اعتبارسنجی باید به تصمیمگیرندگان منتقل شود.
متناسب با ریسک بگویید چرا کار نگه داشته شد، چه چیزی کم است، کدام اقدام ایمن است و پاسخ چه زمانی میرسد. احتمال خام برای ساختن دقت کاذب نشان ندهید. «تماس با پشتیبانی» فقط وقتی مسیر تصمیم فوری است که پشتیبانی مالک تصمیم و قادر به رعایت مهلت باشد.
آستانهها مصنوع نسخهدار انتشارند. با تغییر مدل، پرامپت، پیکره بازیابی، OCR، ابزار، ترکیب زبان، سیاست، رابط کاربری، اختیار اقدام، تیم بازبین یا هزینه خطا آنها را دوباره ارزیابی کنید. نرخ کلی ثابت خودداری میتواند شکست یک برش را پنهان کند؛ افزایش نرخ هم ممکن است کشف ایمن ترافیک پشتیبانینشده باشد.
سیاست را به پایش پس از استقرار وصل کنید. توزیع امتیاز، منحنی ریسک–پوشش، دلیل کمبود شاهد، تغییر تصمیم بازبین، نتیجه دیررس، ظرفیت صف و رخداد را ببینید. یک مجموعه نگهبان ثابت را بازپخش و از تولید جاری نمونه تازه بردارید. وقتی حقیقت نتیجه با تأخیر میرسد، سنجه موقت و بالغ را جدا نگه دارید.
اگر زیرمجموعه پاسخدادهشده دیگر ریسک مصوب را رعایت نمیکند، همان نوع ادعا را تا زمان بررسی محدود یا متوقف کنید. فقط برای خالیکردن صف بازبینی آستانه را پایین نیاورید. نخست ظرفیت، شاهد یا دامنه را تعمیر کنید؛ هر تغییر آستانه همان ارزیابی و تأیید تغییر مدل را میخواهد.
پیش از فعالکردن پاسخ یا اقدام هوش مصنوعی، پاسخ مثبت بخواهید:
هدف این نیست که هوش مصنوعی فروتنتر به نظر برسد. هدف این است که اختیار بیپشتوانه از نظر فنی در دسترس نباشد. سامانه قابلاتکا فقط برای بخشی از کار حق پاسخ به دست میآورد که شاهد، ارزیابی، پیامد و عملیات با هم سازگارند. در بقیه مسیر، مکث خوبطراحیشده بخشی از خود محصول است.

معماری کنترلی عملی برای جداسازی شواهد مستقل، تصمیمهای متأثر از مدل، محتوای مصنوعی و بازخورد تولید پیش از آنکه مدل بعدی از آنها یاد بگیرد.
ادامه مطلب
چارچوب ارزیابی تولیدی برای سنجش وضعیت نهایی، اثر جانبی، بازیابی، شواهد، ایمنی و عملکرد عامل رایانه در تنوع واقعی رابط.
ادامه مطلب
راهنمایی عملی برای پذیرش، قرنطینه یا رد سرورهای MCP، افزونهها و ابزارهای عامل بر پایه منشأ، آزمون قابلیت و محدودیت اجرایی الزامآور.
ادامه مطلباگر این مطلب به یک سامانه واقعی در سازمان شما مربوط است، از خدمات و مطالعه موردی شروع کنید.