
داده مصنوعی با شناسنامه
داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعیبودن به معنی ناشناس یا بیخطر بودن نیست.
ادامه مطلبتیم ژرف ایآی

سازمانها اغلب نتیجهای میخواهند که هیچ عضو بهتنهایی نمیتواند بسازد: الگوی تقلب میان بانکها، شواهد درمان میان بیمارستانها، تقاضای میان تأمینکننده یا reach میان ناشر. متمرکزکردن همه رکوردها شاید ریسک حریم، امنیت، حقوق، تجارت و حاکمیت غیرقابلقبول بسازد. نگهداشتن فایل خام در محل، مواجهه را کم میکند اما بهتنهایی همکاری را خصوصی نمیسازد.
همکاری حفظکننده حریم با خروجی دقیق و threat model شروع میشود. سپس کمینهسازی داده، اختیار حقوقی، حاکمیت، کنترل رمزنگاری یا آماری، مهندسی امن و اندازهگیری را ترکیب میکند. «فدرال»، «رمزشده»، «حذف هویت» و «clean room» هرکدام فقط بخشی از طراحیاند و هیچیک تضمین عمومی حریم نیست.
کوچکترین خروجی مفید را بنویسید: شمارش تجمعی بالای آستانه، مدل آموزشدیده، فهرست match، امتیاز ریسک یا مجموعه آمار تأییدشده. گیرنده، دفعات، granularity و تصمیم اثرپذیر را مشخص کنید. بسیاری از همکاریها چون سطح query محدود نشده، بیش از نیاز افشا میکنند.
هدف را از امکان فنی جدا کنید. شریکی که مجاز به محاسبه aggregate تقلب است نباید خودکار بخش دلخواه مشتری را بکاود. استنباط، join، export و استفاده پاییندست ممنوع را تعریف کنید. انقضا و حذف بگذارید. اگر نتیجه با داده عمومی یا داده شریک ترکیب و فرد یا راز تجاری را آشکار میکند، ایزولهکردن داده خام مسئله را حل نکرده است.
طرفها را نام ببرید: مشارکتکننده داده، اپراتور محاسبه، هماهنگکننده مدل، تحلیلگر، گیرنده خروجی، ارائهدهنده زیرساخت، مهاجم بیرونی و افراد متأثر. بگویید کدام ممکن است درستکار، کنجکاو، مخرب، همدست، compromiseشده یا دردسترسنباشد. دارایی حفاظتشده شامل رکورد، عضویت، صفت، query، update مدل، پارامتر، خروجی، metadata و الگوی دسترسی را تعریف کنید.
سپس حمله را فهرست کنید: query بدون مجوز، reconstruction، membership inference، linkage، gradient leakage، inversion مدل، poisoning، مشارکت sybil، کد مخرب، side channel، differencing خروجی، collusion و سوءاستفاده مدیر. تکنیک فقط نسبت به این مدل معنا دارد. secure aggregation در برابر server کنجکاو، خودکار در برابر client مخرب، update مسموم یا اطلاعات عمدی کدشده در مدل نهایی حفاظت نمیکند.
پیش از مهندسی، اختیار قانونی، هدف، قرارداد، رضایت یا مبنای مربوط، residency، نگهداری و حقوق را بررسی کنید. فناوری حریم استفاده غیرمجاز را مجاز نمیکند. هر فیلد را موجودی و کمترین feature لازم را استخراج کنید. شناسه مستقیم غیرضروری را بردارید، اما داده باقیمانده را بدون ارزیابی مستند re-identification ناشناس ننامید.
در سمت مشارکتکننده schema، provenance و کیفیت را کنترل کنید. مرز سازمان و cohort روشن بماند. مشخص کنید چه کسی dataset، feature، مدل، query، گیرنده یا هدف تازه را تأیید میکند. این کنترل با رمزنگاری قوی هم لازم است، چون سوءاستفاده مجاز و خروجی مضر میتواند در پروتکل درست رخ دهد.
مقاله اصلی یادگیری فدرال مکماهان و همکاران در ۲۰۱۷ آموزش مدل مشترک را با aggregation update محلی و توزیعماندن داده آموزش شرح داد. مسئله داده decentralized و non-IID و کارایی ارتباط را بررسی کرد. ادعا نکرد که locality داده بهتنهایی تضمین کامل حریم هر استقرار است.
یادگیری فدرال محل محاسبه و آنچه از مرز میگذرد را عوض میکند. update، coordinator، انتخاب client، پخش مدل، telemetry و مدل نهایی همچنان حفاظت میخواهند. الگوریتم، جمعیت client، قاعده مشارکت، aggregation، clipping، احراز هویت، مدیریت شکست و سیاست انتشار را ثبت کنید. دقت و حریم را میان سازمانها بسنجید و فرض نکنید test مرکزی همه مشارکتکنندگان را نمایندگی میکند.
مقاله داوریشده Deep Leakage from Gradients حمله بازسازی را در تنظیمات مشخص اشتراک gradient نشان داد. این مدرک است که gradient را بیضرر فرض نکنیم، نه اثبات اینکه هر سامانه فدرال هر رکورد را نشت میدهد. امکان حمله به مدل، batch، پروتکل، دانش مهاجم و دفاع وابسته است.
محرمانگی update را طراحی کنید. مشارکتکننده را احراز، انتقال را رمز، diagnostics را کم، مشاهده هر client را محدود و secure aggregation را بررسی کنید تا coordinator aggregate بگیرد نه update جدا. حمله جاری را روی پیکربندی واقعی تست کنید. update ناهنجار را بدون ساخت side channel آشکارکننده هر client پایش نمایید. update خام را برای «debug» نامحدود نگه ندارید.
NIST SP 800-226 که مارس ۲۰۲۵ نهایی شد، راهنمای ارزیابی تضمین differential privacy و خطرهای رایج اجرای چارچوب ریاضی را ارائه میکند. حریم تفاضلی میتواند تغییر توزیع خروجی هنگام تغییر داده یک واحد حفاظتشده را زیر رابطه همسایگی و پارامتر حریم محدود کند. مترادف افزودن noise نامشخص نیست.
واحد حفاظت، تعریف adjacency، epsilon، delta در صورت کاربرد، clipping، سازوکار noise، فرض sampling، accountant و composition کل در query یا roundهای تکراری را ثبت کنید. پیادهسازی و مسیر end-to-end را بیازمایید. فرمول قوی با sensitivity غلط، composition ثبتنشده، نشت preprocessing قطعی یا رابط query باز، تضمین ادعایی نمیدهد.
پروژه فعال Privacy-Enhancing Cryptography در NIST ابزارهایی چون MPC، private set intersection، FHE، zero-knowledge proof و private information retrieval را بررسی و مواد مرجع و استانداردسازی احتمالی آینده را دنبال میکند. پروژه گواهی بلوغ یا تناسب هر تکنیک برای هر کار نیست.
PSI میتواند شناسه مشترک را زیر پروتکل تعریفشده آشکار کند؛ MPC تابعی روی ورودی چند طرف حساب کند؛ FHE عملیات روی داده رمزشده بدهد؛ ZKP درستی گزاره را بدون افشای witness نشان دهد. هرکدام فرض نشت، اعتماد، کارایی، مدیریت کلید، صحت و اجرا دارند. primitive را پس از تابع و adversary انتخاب کنید و بهجای مونتاژ پروتکل نو از شرح ساده، بازبینی رمزنگاری بگیرید.
secure aggregation میتواند update هر عضو را از coordinator پنهان و مجموع را آشکار کند. aggregate یا مدل آموزشدیده ممکن است با cohort کوچک، differencing roundها، update نامعمول یا مشارکت هدفمند تکراری اطلاعات نشت دهد. برعکس differential privacy شاید contribution خروجی را حفاظت کند اما اگر محاسبه مرکزی ناامن باشد، handling ورودی در معرض بماند.
کنترل را آگاهانه لایه کنید. محاسبه امن احرازشده برای محرمانگی حین پردازش، حداقل cohort، حریم تفاضلی برای تضمین کمّی خروجی، محدودیت query و rate و بازبینی انتشار برای مدل اثرگذار به کار ببرید. بگویید هر لایه کدام تهدید را میگیرد. عبارت «رمزشده و خصوصی تفاضلی» بدون پروتکل، پارامتر، کلید، composition و adversary معنا ندارد.
clean room داده یک ترتیب عملیاتی است، نه خاصیت ریاضی واحد. پیادهسازی از warehouse با کنترل دسترسی تا محاسبه حفاظتشده رمزنگاری متغیر است. محل plaintext، مدیر زیرساخت و کلید، join و query مجاز، فیلتر خروجی و استنباط ممکن از نتیجه تکراری را مستند کنید.
برای همکاری حساس بهجای SQL آزاد، template یا plan تأییدشده بدهید. حداقل cohort بخواهید، cell کوچک را در صورت توجیه suppress یا perturb، مقصد export را کنترل و differencing از query overlap را مهار کنید. در صورت امکان مدیر پلتفرم را از تأیید query جدا سازید. audit log بازدارنده و مدرک است؛ تا معماری دسترسی مدیر ممتاز را حذف نکند، از دیدن داده جلوگیری نمیکند.
Distributed Aggregation Protocol برای اندازهگیری حفظکننده حریم در IETF در تاریخ بازبینی یک Internet-Draft فعال بود، نه RFC یا استاندارد نهایی اینترنت. پیشنویس از مفهوم aggregation توزیعشده قابلراستیآزمایی و measurementهای secret-shared استفاده میکند تا aggregator زیر فرضهای معین نتیجه aggregate بسازد.
این مرجع جاری برای طراحی پروتکل مفید است: نقش صریح، حفاظت replay گزارش، وضعیت aggregation، مدیریت خطا و ملاحظه امنیت مهماند. انطباق با work in progress ادعا نکنید و پروتکل را بدون تحلیل به مسئله دیگر یادگیری ماشین منتقل نسازید. نسخه draft را در آزمایش ثابت و تغییرات را پیش از استقرار مرور کنید.
هویت سازمان و workload با کمترین مجوز به کار ببرید. کلید رمز داده، پروتکل، امضا و ممیزی را جدا و تولید، custody، rotation، recovery و destruction را تعریف کنید. یک مدیر نباید همزمان کد، داده، کلید و انتشار خروجی را کنترل کند. build بازتولیدپذیر، آرتیفکت امضاشده، وابستگی بازبینیشده، اجرای ایزوله و attestation را در صورت پشتیبانی واقعی threat model استفاده کنید.
metadata مانند فهرست عضو، زمان، اندازه dataset، دفعات query و الگوی شکست را حفاظت کنید. اگر traffic analysis مهم است padding، batching یا schedule لازم میشود. عمل مجاز را بدون ثبت راز یا مقدار میانی حساس log کنید. backup، debug، crash dump و مسیر support را تست کنید؛ حریم اغلب بیرون پروتکل اصلی شکست میخورد.
همکاری کنار محرمانگی، ریسک integrity میآورد. سازمان و نسخه نرمافزار فرستنده را تأیید کنید. schema، range، تکرار، provenance و سیاست را بررسی نمایید. در یادگیری فدرال update را bound و poisoning، backdoor، sybil، مشارکت غیراستقلالی و tradeoff robustness را ارزیابی کنید. کنترل حریم میتواند دیدن مشارکت مخرب را دشوار کند.
وعده حریم کامل و attribution کامل ندهید. tradeoff را صریح و تشدید، quarantine یا rollback aggregate را طراحی کنید. جمعیت ارزیابی کنترلشده و حمله مصنوعی بسازید، اما با حاکمیت داده مصنوعی رکورد تولیدی را علامت بزنید تا رفتار مشاهدهشده شریک تلقی نشود.
محاسبه هدف را روی توزیع نماینده و گروه نادر بیازمایید. utility را با معیار تصمیم واقعی بسنجید، نه فقط accuracy مدل. حریم را نسبت به threat model ارزیابی کنید: آزمون empirical reconstruction و membership، راستیآزمایی پروتکل، مرور دسترسی، کنترل کلید، حساب privacy budget، اندازه cohort و تاریخ query. حمله empirical ضعف را نشان میدهد اما نبود همه حملهها را ثابت نمیکند.
نتیجه را بر عضو و cohort گزارش کنید. حریم تفاضلی ممکن است گروه کوچک را متفاوت اثر دهد؛ optimization فدرال روی سایت non-IID ضعیف شود؛ پروتکل امن با dropout یا scale شکست بخورد. تأخیر، compute، ارتباط، بازیابی عملیات و بازبینی انسان را حساب کنید. سامانهای که فقط با onlineبودن همه اعضا خصوصی است برای شبکه ناپایدار آماده تولید نیست.
پیش از انتشار، گیرنده، هدف، نسخه query یا مدل، dataset مشارکتکننده، سیاست، حداقل cohort، privacy budget، کنترل افشا و تأیید را بررسی کنید. محدودیت نتیجه را ضمیمه کنید: جمعیت، تاریخ، کاربرد، تصمیم ممنوع، عدمقطعیت و bias شناختهشده. مدل مشترک نباید بیصدا سرویس عمومی برای گیرنده تازه شود.
دسترسی پاییندست را پایش و هرجا فنی ممکن است لغو کنید. برای مدلی که اطلاعات آموزش را حفظ یا آشکار میکند، memorization را بیازمایید و رابط را محدود سازید. خروجی پرخطر بازبینی حقوق، حریم، امنیت، آمار و دامنه مربوط را میخواهد. این مقاله راهنمای مهندسی است، نه تضمین حقوقی یا رمزنگاری استقرار خاص.
مشخص کنید با خروج شریک، dataset غیرقانونی یا خراب، compromise کلید، عبور privacy budget یا سوءاستفاده خروجی چه میشود. بعضی aggregate منتشرشده پسگرفتنی نیست و بعضی مدل آموزشدیده retraining میخواهد. قرارداد و ارتباط کاربر باید این حد فنی را بازتاب دهد، نه وعده حذف ناممکن.
lineage از عضو و نسخه dataset تا محاسبه و خروجی نگه دارید. توقف query، rotation کلید، حذف عضو، invalidation آرتیفکت و اطلاع شریک را تمرین کنید. مدرک حادثه را بدون کپی گسترده داده حساس حفظ نمایید. حریم روی دستگاه الگوهای مربوط برای نزدیک نگهداشتن محاسبه به منبع را همراه با ریسک update، telemetry و چرخه عمر توضیح میدهد.
ابتدا یک aggregate با ارزش مشترک روشن و ریسک re-identification پایین انتخاب کنید. طرفها، تهدید، خروجی مجاز، مبنای حقوقی و مدیریت شکست را تعریف کنید. prototype کنترلشده معمولی را با داده مصنوعی یا داده واقعاً مجاز بسازید تا semantics تأیید شود. سپس سازوکار حریم را انتخاب و از بازبین مستقل حریم، امنیت و رمزنگاری آزمون بگیرید.
با چند عضو، حداقل cohort، بازبینی سخت خروجی و شواهد نسخهدار پایلوت کنید. پارامتر حریم، utility، dropout، هزینه و عملیات شریک را بسنجید. تابع تازه فقط با مرور دوباره تهدید و هدف اضافه شود. هدف بیشترین محاسبه روی داده پنهان نیست؛ مجموعه کوچکی از نتایج مفید و قابلدفاع است که طرفها و افراد متأثر بتوانند اعتماد کنند.
منابع در ۳۰ ژوئیه ۲۰۲۶ بازبینی شدند. NIST SP 800-226 راهنمای نهایی ارزیابی تضمین differential privacy است. پروژه NIST PEC برنامه فعال بررسی ابزار نوظهور و استانداردسازی احتمالی است و پیادهسازی را گواهی نمیکند. مقاله یادگیری فدرال و leakage یافتههایی در تنظیمات پژوهشی خود دارند. IETF DAP یک Internet-Draft فعال بود، نه RFC یا استاندارد نهایی.
منابع اصلی و معتبر:

داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعیبودن به معنی ناشناس یا بیخطر بودن نیست.
ادامه مطلب
راهنمای عملی ۲۰۲۶ برای فهرست رمزنگاری، استانداردهای پساکوانتومی NIST، کشف با کمک هوش مصنوعی، چابکی رمزنگاری و شواهد انتشار.
ادامه مطلب
از تأیید تا عملیات چندمرحلهای: چگونه عاملهای هوش مصنوعی فرایندهای پراکنده کسبوکار را به جریان کاری قابل نظارت و حاکمیت تبدیل میکنند.
ادامه مطلبگزارش روزانه و راهنماهای عملیاتی ژرف را ببینید. این صفحه یک آرشیو موضوعی است، نه دعوت به شروع پروژه.