سیگنال مشترک: هوش مصنوعی در همکاری داده‌ای خصوصی

ت

تیم ژرف ای‌آی

۲۵ اردیبهشت ۱۴۰۵به‌روزرسانی ۸ مرداد ۱۴۰۵۱۱ دقیقه مطالعه
سیگنال مشترک: هوش مصنوعی در همکاری داده‌ای خصوصی

سازمان‌ها اغلب نتیجه‌ای می‌خواهند که هیچ عضو به‌تنهایی نمی‌تواند بسازد: الگوی تقلب میان بانک‌ها، شواهد درمان میان بیمارستان‌ها، تقاضای میان تأمین‌کننده یا reach میان ناشر. متمرکزکردن همه رکوردها شاید ریسک حریم، امنیت، حقوق، تجارت و حاکمیت غیرقابل‌قبول بسازد. نگه‌داشتن فایل خام در محل، مواجهه را کم می‌کند اما به‌تنهایی همکاری را خصوصی نمی‌سازد.

همکاری حفظ‌کننده حریم با خروجی دقیق و threat model شروع می‌شود. سپس کمینه‌سازی داده، اختیار حقوقی، حاکمیت، کنترل رمزنگاری یا آماری، مهندسی امن و اندازه‌گیری را ترکیب می‌کند. «فدرال»، «رمزشده»، «حذف هویت» و «clean room» هرکدام فقط بخشی از طراحی‌اند و هیچ‌یک تضمین عمومی حریم نیست.

پیش از اشتراک داده، نتیجه را تعریف کنید

کوچک‌ترین خروجی مفید را بنویسید: شمارش تجمعی بالای آستانه، مدل آموزش‌دیده، فهرست match، امتیاز ریسک یا مجموعه آمار تأییدشده. گیرنده، دفعات، granularity و تصمیم اثرپذیر را مشخص کنید. بسیاری از همکاری‌ها چون سطح query محدود نشده، بیش از نیاز افشا می‌کنند.

هدف را از امکان فنی جدا کنید. شریکی که مجاز به محاسبه aggregate تقلب است نباید خودکار بخش دلخواه مشتری را بکاود. استنباط، join، export و استفاده پایین‌دست ممنوع را تعریف کنید. انقضا و حذف بگذارید. اگر نتیجه با داده عمومی یا داده شریک ترکیب و فرد یا راز تجاری را آشکار می‌کند، ایزوله‌کردن داده خام مسئله را حل نکرده است.

threat model صریح بسازید

طرف‌ها را نام ببرید: مشارکت‌کننده داده، اپراتور محاسبه، هماهنگ‌کننده مدل، تحلیل‌گر، گیرنده خروجی، ارائه‌دهنده زیرساخت، مهاجم بیرونی و افراد متأثر. بگویید کدام ممکن است درستکار، کنجکاو، مخرب، هم‌دست، compromiseشده یا دردسترس‌نباشد. دارایی حفاظت‌شده شامل رکورد، عضویت، صفت، query، update مدل، پارامتر، خروجی، metadata و الگوی دسترسی را تعریف کنید.

سپس حمله را فهرست کنید: query بدون مجوز، reconstruction، membership inference، linkage، gradient leakage، inversion مدل، poisoning، مشارکت sybil، کد مخرب، side channel، differencing خروجی، collusion و سوءاستفاده مدیر. تکنیک فقط نسبت به این مدل معنا دارد. secure aggregation در برابر server کنجکاو، خودکار در برابر client مخرب، update مسموم یا اطلاعات عمدی کدشده در مدل نهایی حفاظت نمی‌کند.

ابتدا ورودی را کمینه و حاکمیت کنید

پیش از مهندسی، اختیار قانونی، هدف، قرارداد، رضایت یا مبنای مربوط، residency، نگهداری و حقوق را بررسی کنید. فناوری حریم استفاده غیرمجاز را مجاز نمی‌کند. هر فیلد را موجودی و کمترین feature لازم را استخراج کنید. شناسه مستقیم غیرضروری را بردارید، اما داده باقی‌مانده را بدون ارزیابی مستند re-identification ناشناس ننامید.

در سمت مشارکت‌کننده schema، provenance و کیفیت را کنترل کنید. مرز سازمان و cohort روشن بماند. مشخص کنید چه کسی dataset، feature، مدل، query، گیرنده یا هدف تازه را تأیید می‌کند. این کنترل با رمزنگاری قوی هم لازم است، چون سوءاستفاده مجاز و خروجی مضر می‌تواند در پروتکل درست رخ دهد.

بدانید یادگیری فدرال چه چیزی را برقرار می‌کند

مقاله اصلی یادگیری فدرال مک‌ماهان و همکاران در ۲۰۱۷ آموزش مدل مشترک را با aggregation update محلی و توزیع‌ماندن داده آموزش شرح داد. مسئله داده decentralized و non-IID و کارایی ارتباط را بررسی کرد. ادعا نکرد که locality داده به‌تنهایی تضمین کامل حریم هر استقرار است.

یادگیری فدرال محل محاسبه و آنچه از مرز می‌گذرد را عوض می‌کند. update، coordinator، انتخاب client، پخش مدل، telemetry و مدل نهایی همچنان حفاظت می‌خواهند. الگوریتم، جمعیت client، قاعده مشارکت، aggregation، clipping، احراز هویت، مدیریت شکست و سیاست انتشار را ثبت کنید. دقت و حریم را میان سازمان‌ها بسنجید و فرض نکنید test مرکزی همه مشارکت‌کنندگان را نمایندگی می‌کند.

update مدل را بالقوه حساس بدانید

مقاله داوری‌شده Deep Leakage from Gradients حمله بازسازی را در تنظیمات مشخص اشتراک gradient نشان داد. این مدرک است که gradient را بی‌ضرر فرض نکنیم، نه اثبات اینکه هر سامانه فدرال هر رکورد را نشت می‌دهد. امکان حمله به مدل، batch، پروتکل، دانش مهاجم و دفاع وابسته است.

محرمانگی update را طراحی کنید. مشارکت‌کننده را احراز، انتقال را رمز، diagnostics را کم، مشاهده هر client را محدود و secure aggregation را بررسی کنید تا coordinator aggregate بگیرد نه update جدا. حمله جاری را روی پیکربندی واقعی تست کنید. update ناهنجار را بدون ساخت side channel آشکارکننده هر client پایش نمایید. update خام را برای «debug» نامحدود نگه ندارید.

حریم تفاضلی را سازوکار کمّی به کار ببرید

NIST SP 800-226 که مارس ۲۰۲۵ نهایی شد، راهنمای ارزیابی تضمین differential privacy و خطرهای رایج اجرای چارچوب ریاضی را ارائه می‌کند. حریم تفاضلی می‌تواند تغییر توزیع خروجی هنگام تغییر داده یک واحد حفاظت‌شده را زیر رابطه همسایگی و پارامتر حریم محدود کند. مترادف افزودن noise نامشخص نیست.

واحد حفاظت، تعریف adjacency، epsilon، delta در صورت کاربرد، clipping، سازوکار noise، فرض sampling، accountant و composition کل در query یا roundهای تکراری را ثبت کنید. پیاده‌سازی و مسیر end-to-end را بیازمایید. فرمول قوی با sensitivity غلط، composition ثبت‌نشده، نشت preprocessing قطعی یا رابط query باز، تضمین ادعایی نمی‌دهد.

رمزنگاری تقویت‌کننده حریم را با کار تطبیق دهید

پروژه فعال Privacy-Enhancing Cryptography در NIST ابزارهایی چون MPC، private set intersection، FHE، zero-knowledge proof و private information retrieval را بررسی و مواد مرجع و استانداردسازی احتمالی آینده را دنبال می‌کند. پروژه گواهی بلوغ یا تناسب هر تکنیک برای هر کار نیست.

PSI می‌تواند شناسه مشترک را زیر پروتکل تعریف‌شده آشکار کند؛ MPC تابعی روی ورودی چند طرف حساب کند؛ FHE عملیات روی داده رمزشده بدهد؛ ZKP درستی گزاره را بدون افشای witness نشان دهد. هرکدام فرض نشت، اعتماد، کارایی، مدیریت کلید، صحت و اجرا دارند. primitive را پس از تابع و adversary انتخاب کنید و به‌جای مونتاژ پروتکل نو از شرح ساده، بازبینی رمزنگاری بگیرید.

secure aggregation را از حریم خروجی جدا کنید

secure aggregation می‌تواند update هر عضو را از coordinator پنهان و مجموع را آشکار کند. aggregate یا مدل آموزش‌دیده ممکن است با cohort کوچک، differencing roundها، update نامعمول یا مشارکت هدفمند تکراری اطلاعات نشت دهد. برعکس differential privacy شاید contribution خروجی را حفاظت کند اما اگر محاسبه مرکزی ناامن باشد، handling ورودی در معرض بماند.

کنترل را آگاهانه لایه کنید. محاسبه امن احرازشده برای محرمانگی حین پردازش، حداقل cohort، حریم تفاضلی برای تضمین کمّی خروجی، محدودیت query و rate و بازبینی انتشار برای مدل اثرگذار به کار ببرید. بگویید هر لایه کدام تهدید را می‌گیرد. عبارت «رمزشده و خصوصی تفاضلی» بدون پروتکل، پارامتر، کلید، composition و adversary معنا ندارد.

clean room را سامانه حاکمیت‌شده طراحی کنید

clean room داده یک ترتیب عملیاتی است، نه خاصیت ریاضی واحد. پیاده‌سازی از warehouse با کنترل دسترسی تا محاسبه حفاظت‌شده رمزنگاری متغیر است. محل plaintext، مدیر زیرساخت و کلید، join و query مجاز، فیلتر خروجی و استنباط ممکن از نتیجه تکراری را مستند کنید.

برای همکاری حساس به‌جای SQL آزاد، template یا plan تأییدشده بدهید. حداقل cohort بخواهید، cell کوچک را در صورت توجیه suppress یا perturb، مقصد export را کنترل و differencing از query overlap را مهار کنید. در صورت امکان مدیر پلتفرم را از تأیید query جدا سازید. audit log بازدارنده و مدرک است؛ تا معماری دسترسی مدیر ممتاز را حذف نکند، از دیدن داده جلوگیری نمی‌کند.

از پیش‌نویس اندازه‌گیری خصوصی با احتیاط بیاموزید

Distributed Aggregation Protocol برای اندازه‌گیری حفظ‌کننده حریم در IETF در تاریخ بازبینی یک Internet-Draft فعال بود، نه RFC یا استاندارد نهایی اینترنت. پیش‌نویس از مفهوم aggregation توزیع‌شده قابل‌راستی‌آزمایی و measurementهای secret-shared استفاده می‌کند تا aggregator زیر فرض‌های معین نتیجه aggregate بسازد.

این مرجع جاری برای طراحی پروتکل مفید است: نقش صریح، حفاظت replay گزارش، وضعیت aggregation، مدیریت خطا و ملاحظه امنیت مهم‌اند. انطباق با work in progress ادعا نکنید و پروتکل را بدون تحلیل به مسئله دیگر یادگیری ماشین منتقل نسازید. نسخه draft را در آزمایش ثابت و تغییرات را پیش از استقرار مرور کنید.

هویت، کلید و کد را حفاظت کنید

هویت سازمان و workload با کمترین مجوز به کار ببرید. کلید رمز داده، پروتکل، امضا و ممیزی را جدا و تولید، custody، rotation، recovery و destruction را تعریف کنید. یک مدیر نباید هم‌زمان کد، داده، کلید و انتشار خروجی را کنترل کند. build بازتولیدپذیر، آرتیفکت امضاشده، وابستگی بازبینی‌شده، اجرای ایزوله و attestation را در صورت پشتیبانی واقعی threat model استفاده کنید.

metadata مانند فهرست عضو، زمان، اندازه dataset، دفعات query و الگوی شکست را حفاظت کنید. اگر traffic analysis مهم است padding، batching یا schedule لازم می‌شود. عمل مجاز را بدون ثبت راز یا مقدار میانی حساس log کنید. backup، debug، crash dump و مسیر support را تست کنید؛ حریم اغلب بیرون پروتکل اصلی شکست می‌خورد.

مشارکت‌کننده را اعتبارسنجی و با poisoning مقابله کنید

همکاری کنار محرمانگی، ریسک integrity می‌آورد. سازمان و نسخه نرم‌افزار فرستنده را تأیید کنید. schema، range، تکرار، provenance و سیاست را بررسی نمایید. در یادگیری فدرال update را bound و poisoning، backdoor، sybil، مشارکت غیراستقلالی و tradeoff robustness را ارزیابی کنید. کنترل حریم می‌تواند دیدن مشارکت مخرب را دشوار کند.

وعده حریم کامل و attribution کامل ندهید. tradeoff را صریح و تشدید، quarantine یا rollback aggregate را طراحی کنید. جمعیت ارزیابی کنترل‌شده و حمله مصنوعی بسازید، اما با حاکمیت داده مصنوعی رکورد تولیدی را علامت بزنید تا رفتار مشاهده‌شده شریک تلقی نشود.

حریم و utility را با هم ارزیابی کنید

محاسبه هدف را روی توزیع نماینده و گروه نادر بیازمایید. utility را با معیار تصمیم واقعی بسنجید، نه فقط accuracy مدل. حریم را نسبت به threat model ارزیابی کنید: آزمون empirical reconstruction و membership، راستی‌آزمایی پروتکل، مرور دسترسی، کنترل کلید، حساب privacy budget، اندازه cohort و تاریخ query. حمله empirical ضعف را نشان می‌دهد اما نبود همه حمله‌ها را ثابت نمی‌کند.

نتیجه را بر عضو و cohort گزارش کنید. حریم تفاضلی ممکن است گروه کوچک را متفاوت اثر دهد؛ optimization فدرال روی سایت non-IID ضعیف شود؛ پروتکل امن با dropout یا scale شکست بخورد. تأخیر، compute، ارتباط، بازیابی عملیات و بازبینی انسان را حساب کنید. سامانه‌ای که فقط با onlineبودن همه اعضا خصوصی است برای شبکه ناپایدار آماده تولید نیست.

انتشار خروجی را مرز پاسخ‌گو کنید

پیش از انتشار، گیرنده، هدف، نسخه query یا مدل، dataset مشارکت‌کننده، سیاست، حداقل cohort، privacy budget، کنترل افشا و تأیید را بررسی کنید. محدودیت نتیجه را ضمیمه کنید: جمعیت، تاریخ، کاربرد، تصمیم ممنوع، عدم‌قطعیت و bias شناخته‌شده. مدل مشترک نباید بی‌صدا سرویس عمومی برای گیرنده تازه شود.

دسترسی پایین‌دست را پایش و هرجا فنی ممکن است لغو کنید. برای مدلی که اطلاعات آموزش را حفظ یا آشکار می‌کند، memorization را بیازمایید و رابط را محدود سازید. خروجی پرخطر بازبینی حقوق، حریم، امنیت، آمار و دامنه مربوط را می‌خواهد. این مقاله راهنمای مهندسی است، نه تضمین حقوقی یا رمزنگاری استقرار خاص.

لغو و پاسخ حادثه را اداره کنید

مشخص کنید با خروج شریک، dataset غیرقانونی یا خراب، compromise کلید، عبور privacy budget یا سوءاستفاده خروجی چه می‌شود. بعضی aggregate منتشرشده پس‌گرفتنی نیست و بعضی مدل آموزش‌دیده retraining می‌خواهد. قرارداد و ارتباط کاربر باید این حد فنی را بازتاب دهد، نه وعده حذف ناممکن.

lineage از عضو و نسخه dataset تا محاسبه و خروجی نگه دارید. توقف query، rotation کلید، حذف عضو، invalidation آرتیفکت و اطلاع شریک را تمرین کنید. مدرک حادثه را بدون کپی گسترده داده حساس حفظ نمایید. حریم روی دستگاه الگوهای مربوط برای نزدیک نگه‌داشتن محاسبه به منبع را همراه با ریسک update، telemetry و چرخه عمر توضیح می‌دهد.

برنامه مرحله‌ای همکاری

ابتدا یک aggregate با ارزش مشترک روشن و ریسک re-identification پایین انتخاب کنید. طرف‌ها، تهدید، خروجی مجاز، مبنای حقوقی و مدیریت شکست را تعریف کنید. prototype کنترل‌شده معمولی را با داده مصنوعی یا داده واقعاً مجاز بسازید تا semantics تأیید شود. سپس سازوکار حریم را انتخاب و از بازبین مستقل حریم، امنیت و رمزنگاری آزمون بگیرید.

با چند عضو، حداقل cohort، بازبینی سخت خروجی و شواهد نسخه‌دار پایلوت کنید. پارامتر حریم، utility، dropout، هزینه و عملیات شریک را بسنجید. تابع تازه فقط با مرور دوباره تهدید و هدف اضافه شود. هدف بیشترین محاسبه روی داده پنهان نیست؛ مجموعه کوچکی از نتایج مفید و قابل‌دفاع است که طرف‌ها و افراد متأثر بتوانند اعتماد کنند.

یادداشت منابع

منابع در ۳۰ ژوئیه ۲۰۲۶ بازبینی شدند. NIST SP 800-226 راهنمای نهایی ارزیابی تضمین differential privacy است. پروژه NIST PEC برنامه فعال بررسی ابزار نوظهور و استانداردسازی احتمالی است و پیاده‌سازی را گواهی نمی‌کند. مقاله یادگیری فدرال و leakage یافته‌هایی در تنظیمات پژوهشی خود دارند. IETF DAP یک Internet-Draft فعال بود، نه RFC یا استاندارد نهایی.

منابع اصلی و معتبر:

#حریم داده#همکاری داده‌ای#یادگیری توزیع‌شده#حاکمیت داده#هوش مصنوعی

مطالب مرتبط

داده مصنوعی با شناسنامه
بینش‌های صنعت

داده مصنوعی با شناسنامه

داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعی‌بودن به معنی ناشناس یا بی‌خطر بودن نیست.

ادامه مطلب

ادامه مطالعه

گزارش روزانه و راهنماهای عملیاتی ژرف را ببینید. این صفحه یک آرشیو موضوعی است، نه دعوت به شروع پروژه.