اتاق محاسبات خصوصی: هوش مصنوعی و فناوری‌های تقویت حریم خصوصی

ت

تیم ژرف ای‌آی

۲ تیر ۱۴۰۵به‌روزرسانی ۸ مرداد ۱۴۰۵۱۱ دقیقه مطالعه
اتاق محاسبات خصوصی: هوش مصنوعی و فناوری‌های تقویت حریم خصوصی

فناوری تقویت حریم خصوصی یا PET داده حساس را بی‌خطر نمی‌کند. مشخص می‌کند چه کسی کدام نمایش را تحت چه فرضی و با چه نشت قابل اندازه‌گیری ببیند. برچسب محاسبات محرمانه لاگ نامحدود پرامپت را درست نمی‌کند؛ یادگیری فدرال به‌تنهایی هماهنگ‌کننده مخرب را متوقف نمی‌کند؛ داده مصنوعی ممکن است فرد کمیاب را افشا کند و حریم خصوصی تفاضلی بدون بودجه ردیابی‌شده فقط نمایش است.

پرسش درست «کدام PET را بخریم؟» نیست. باید پرسید: چه محاسبه مفیدی لازم است، به کدام طرف و مؤلفه اعتماد نداریم، هرکدام چه چیزی مجازند یاد بگیرند و این مرز چگونه راستی‌آزمایی می‌شود؟ پاسخ معمولاً کمینه‌سازی، امنیت عادی، حاکمیت حقوقی و یک یا چند PET را ترکیب می‌کند.

با محاسبه و مدل تهدید شروع کنید

پیش از فناوری، قرارداد حریم خصوصی بنویسید:

جزءپرسش
هدفچه تصمیم یا آماری لازم است؟ آیا AI ضروری است؟
مردمداده چه کسانی، از جمله فرد حاضر یا استنباط‌شده، درگیر است؟
ورودیکدام فیلد خام، برچسب، فراداده و شناسه وجود دارد؟
خروجیچه مدل، امتیاز، embedding، تجمیع یا اقدامی مرز را ترک می‌کند؟
طرف‌هادارنده داده، ارائه‌دهنده مدل، اپراتور محاسبه، تحلیلگر، گیرنده، ممیز
مهاجمکنجکاو ولی مطابق پروتکل، مشارکت‌کننده مخرب، تبانی، مهاجم بیرونی
نشتعضویت، ویژگی، بازسازی، پیوند، استخراج مدل، کانال جانبی
عمرنگهداری، افق بودجه، چرخش کلید، حذف و artifact مشتق
حقوقاطلاع، دسترسی، اصلاح، اعتراض، حذف و بازبینی انسان در صورت شمول

«داده را رمز کن» ناقص است. داده در سکون و انتقال محافظت می‌شود، اما هنگام پردازش، خروجی مدل، الگوی دسترسی یا trace دیباگ افشا می‌شود. اعتماد را در هر گذار تعریف کنید.

ارزیابی اثر حفاظت داده و بررسی قانون محل را انجام دهید. چارچوب حریم خصوصی NIST ابزار داوطلبانه مدیریت ریسک است، نه گواهی یا مشاوره حقوقی. PET به کمینه‌سازی و امنیت کمک می‌کند، اما تنظیم‌گری مانند ICO بریتانیا صریحاً آن را کمک انطباق می‌داند، نه جایگزین مبنای قانونی، شفافیت، محدودیت هدف یا حقوق افراد.

پیش از رمزنگاری پیشرفته کمینه کنید

قوی‌ترین بهبود اغلب نگرفتن یا نفرستادن فیلد است. بپرسید آیا کار می‌تواند از این استفاده کند:

  • شمارش به‌جای ردیف؛
  • دسته به‌جای متن آزاد؛
  • بازه سن به‌جای تاریخ تولد؛
  • ویژگی مشتق به‌جای سند اصلی؛
  • فیلتر محلی پیش از درخواست ابری؛
  • نتیجه واکشی به‌جای کل مخزن؛
  • نمایش گذرا به‌جای حافظه دائمی.

شناسه مستقیم، شبه‌شناسه، صفت حساس، برچسب، پرامپت و فراداده عملیاتی را جدا کنید. شمار توکن، پیام خطا، زمان، نام فایل و الگوی دسترسی حتی با رمزبودن محتوا اطلاعات می‌دهند.

حذف باید زمینه‌آگاه و آزموده باشد. برداشتن نام، ترکیب بیماری کمیاب، محل دقیق، کارفرما و تاریخ را ناشناس نمی‌کند. مستعارسازی پیوندپذیری را نگه می‌دارد و در بسیاری نظام‌ها همچنان داده شخصی است.

برای کنترل حافظه حافظه بدون نظارت را ببینید.

PET را با مرز تطبیق دهید

حریم خصوصی تفاضلی

DP محدود می‌کند توزیع خروجی با اضافه یا حذف داده یک فرد چقدر عوض شود و برای آمار، تله‌متری، آموزش و برخی داده‌های مصنوعی مفید است.

ادعای واقعی باید adjacency، مکانیزم، اپسیلون (ε)، دلتا (δ) در صورت استفاده، clipping یا سقف مشارکت، روش حسابداری و افق composition را بگوید. NIST SP 800-226 که در ۲۰۲۵ نهایی شد ارزیابی تضمین کامل و خطر پیاده‌سازی را می‌خواهد، نه چسباندن «DP» به محصول.

اپسیلون کوچک‌تر عموماً حریم قوی‌تر است، اما بدون تعریف کامل قابل مقایسه نیست. پرس‌وجوی تکراری بودجه مصرف می‌کند. endpoint دیباگ، انتشار زیرگروه و retry باید در حسابدار باشند.

محاسبه چندطرفه امن و عملیات مجموعه خصوصی

MPC اجازه می‌دهد طرف‌ها تابعی روی ورودی‌ها حساب کنند بدون اینکه یک طرف همه داده خام را بگیرد. PSI الگوی محدودتری برای یافتن اشتراک مجموعه و گاهی مقدار همراه است.

امنیت به پروتکل، تعداد طرف، آستانه فساد، مدل مخرب یا نیمه‌صادق، فرض تبانی و خروجی وابسته است. MPC ورودی را جز آنچه خروجی آشکار می‌کند پنهان می‌سازد؛ خروجی بیش‌ازحد افشاگر را خصوصی نمی‌کند.

رمزنگاری همریخت

رمزنگاری همریخت بخشی از محاسبه را روی مقدار رمز ممکن می‌کند و اعتماد به اپراتور محاسبه را کم می‌کند، اما عملیات پشتیبانی‌شده، تقریب عددی، تأخیر، بزرگ‌شدن متن رمز و مالک کلید مهم‌اند. inference رمز ممکن است ورودی را حفظ و ساختار مدل یا خروجی را به طرف دیگری بدهد.

مدار و دقت واقعی را بسنجید، نه عملیات اسباب‌بازی. چرخش، پشتیبان، بازیابی و لغو کلید را پیش از تولید طراحی کنید.

محیط اجرای مورد اعتماد و محاسبات محرمانه

TEE کد و داده را هنگام استفاده جدا می‌کند و remote attestation می‌دهد. اعتماد از کل اپراتور زیرساخت به سخت‌افزار، firmware، تصدیق، اندازه‌گیری بارکاری و زنجیره تامین منتقل می‌شود.

TEE کانال جانبی، کد آلوده داخل enclave، خروجی زیاد، rollback یا نشت پیش و پس از مرز را خودکار متوقف نمی‌کند. measurement دقیق را بررسی، در attestation نامعتبر بسته شکست، رابط enclave را کوچک و سکو را patch کنید.

یادگیری فدرال

یادگیری فدرال به‌روزرسانی آموزش را به داده توزیع‌شده نزدیک می‌کند. جمع‌آوری مرکزی مثال خام کم می‌شود، اما گرادیان یا update شاید اطلاعات بدهد و هماهنگ‌کننده یا مشارکت‌کننده مدل را مسموم کند. secure aggregation، clipping، تجمیع مقاوم، احراز طرف و اغلب DP لازم است.

«داده دستگاه را ترک نمی‌کند» وقتی update، معیار، crash log یا نمونه ارزیابی بیرون می‌رود گمراه‌کننده است.

اثبات دانش صفر و محاسبه قابل راستی‌آزمایی

اثبات دانش صفر نشان می‌دهد گزاره یا محاسبه شرطی را دارد بدون افشای شاهد زیرین. برای اثبات صلاحیت، رعایت سیاست یا ویژگی اجرا مفید است. حقیقت ورودی یا مناسب‌بودن مدل را ثابت نمی‌کند مگر همان‌ها جزو گزاره باشند.

هر تکنیک یک مرز را حفظ می‌کند، نه کل چرخه را. گزارش ۲۰۲۵ OECD نیز ترکیب TEE، یادگیری فدرال، MPC، DP و رمزنگاری همریخت را بیان و درباره توازن سودمندی، کارایی و کاربردپذیری هشدار می‌دهد.

حفاظت‌ها را آگاهانه ترکیب کنید

سامانه عملی ممکن است ترکیب کند:

  • حذف و استخراج ویژگی محلی؛
  • آموزش فدرال؛
  • secure aggregation با MPC؛
  • clipping و DP مرکزی یا توزیع‌شده؛
  • تجمیع در TEE با attestation؛
  • ذخیره رمز و نگهداری کوتاه؛
  • انتشار خروجی با دروازه سیاست.

ترکیب شکاف را می‌بندد یا شکاف تازه می‌سازد:

  • آیا اپراتور TEE کلید رمزگشایی هم دارد؟
  • آیا دو طرف MPC می‌توانند تبانی کنند؟
  • DP پیش یا پس از secure aggregation است؟
  • fallback شکست داده خام می‌فرستد؟
  • retry در بودجه شمرده می‌شود؟
  • تله‌متری محیط حفاظت‌شده را ترک می‌کند؟
  • ارزیابی مدل کپی محافظت‌نشده دارد؟

نمودار جریان را در سطح فیلد بکشید و plaintext، مستعار، رمز، تجمیع و DP را علامت بزنید. مالک کلید و فرض اعتماد را بنویسید و با هر تغییر گردش‌کار به‌روز کنید.

مثال عملی: کشف cohort میان بیمارستان‌ها

سه بیمارستان می‌خواهند تعداد بیمار واجد معیار پژوهش را بدون تجمیع پرونده کامل برآورد کنند:

  1. پرس‌وجوی cohort، هدف مجاز، گیرنده، حداقل اندازه گروه، نگهداری و رفتار انصراف را توافق می‌کنند.
  2. هر بیمارستان کیفیت داده را محلی می‌سنجد و به طرح مشترک تبدیل می‌کند.
  3. شناسه مستقیم محلی می‌ماند. PSI یا پیوند خصوصی اشتراک را پیدا می‌کند تا فرد دوبار شمرده نشود؛ مدل تبانی و پیوند مستند است.
  4. MPC شمارش و آمار منتخب را می‌سازد و هیچ طرف ردیف طرف دیگر را نمی‌گیرد.
  5. سقف مشارکت و DP از آمار زیرگروه محافظت می‌کند. حسابدار مرکزی هر انتشار را از بودجه مصوب کم می‌کند.
  6. سیاست سلول کوچک را پنهان و پرس‌وجوی پی‌درپی دلخواه را مسدود می‌کند.
  7. خروجی نسخه پرس‌وجو، سایت‌ها، پارامتر DP، بازه سودمندی، caveat کیفیت و مرجع ممیزی دارد.
  8. داده موقت و کلید پاک و شواهد لازم جدا نگهداری می‌شود.

این طرح همچنان اخلاق، حاکمیت، امنیت و قانون می‌خواهد. MPC داده سوگیر را درست نمی‌کند، DP نتیجه بالینی نامعتبر را معتبر نمی‌کند و شمار کوچک حتی بدون انتقال ردیف حساس است.

کل چرخه هوش مصنوعی را محافظت کنید

  1. جمع‌آوری: رضایت یا مبنای دیگر، کمینه‌سازی، مجوز دستگاه؛
  2. آماده‌سازی: برچسب، حذف تکرار، join و feature store؛
  3. آموزش: مثال، گرادیان، checkpoint، optimizer state و update؛
  4. ارزیابی: holdout، شکست، بازبینی و گزارش برش؛
  5. استقرار: پرامپت، واکشی، embedding، کش، endpoint و ابزار؛
  6. پایش: trace، log، بازخورد، گزارش سوءاستفاده و رخداد؛
  7. بازنشستگی: مدل، index، replica، backup، کلید و حذف فروشنده.

Embedding ذاتاً ناشناس نیست. مدل می‌تواند حفظ کند، سیگنال عضویت بدهد یا ویژگی حساس را نشان دهد. داده مصنوعی باید برای خطر افشا در برابر منبع و سودمندی کار سنجیده شود؛ حاکمیت داده مصنوعی را ببینید.

خروجی را هم کنترل کنید. خط آموزش محافظت‌شده می‌تواند مدلی بسازد که از retrieval یا ابزار گسترده رکورد شخصی برگرداند.

مرز قابل راستی‌آزمایی مهندسی کنید

برای هر محاسبه نگه دارید:

  • نسخه پروتکل و کتابخانه؛
  • مدل امنیت و پارامتر رمزنگاری؛
  • measurement و سیاست attestation؛
  • موجودی، مالک، چرخش، بازیابی و نابودی کلید؛
  • تعریف DP، حسابدار، مالک بودجه و دفتر انتشار؛
  • هویت و مجوز مشارکت‌کننده؛
  • طرح ورودی و سقف مشارکت؛
  • سیاست خروجی و بررسی افشا؛
  • آزمون عملکرد و دقت؛
  • بازبینی تهدید و آزمون مستقل.

رمزنگاری اختراع نکنید. پیاده‌سازی بازبینی‌شده و پارامتر جاری به‌کار ببرید، کلید را جدا کنید و برای کار پرریسک متخصص مستقل بگیرید. گواهی یک جزء جریان کامل را معتبر نمی‌کند.

همکاری داده با حفظ حریم خصوصی قرارداد سازمانی اطراف این کنترل را شرح می‌دهد.

حریم، سودمندی و عملیات را با هم بسنجید

بُعدنمونه معیار
حریمبودجه DP، موفقیت حمله، خطر افشا، کوچک‌ترین گروه منتشر
امنیتشکست attestation، سن کلید، درخواست بدون مجوز، یافته جانبی و dependency
سودمندیدقت کار، کالیبراسیون، خطای زیرگروه، سوگیری آماری، توافق تصمیم
عملکردتأخیر، throughput، رشد ciphertext، هزینه محاسبه و شبکه
حاکمیتانتشار بازبینی‌نشده، زمان حذف، بازبینی دسترسی، استثنا، درخواست فرد

آزمون عضویت، بازسازی، پیوند، استخراج مدل، مسمومیت، تبانی و rollback متناسب با تهدید اجرا کنید. عبور از یک حمله اثبات حریم نیست؛ دانش و منابع مهاجم را ثبت کنید.

برای DP، تعریف ریاضی و نرم‌افزار واقعی را جدا بسنجید. چارچوب «خطر حریم» NIST SP 800-226 مفید است چون معادله درست ممکن است با مشارکت اشتباه، پیش‌فرض ناامن، دقت محدود یا خطای composition خراب شود.

نمایش‌های رایج حریم خصوصی

  • «ناشناس» بدون مدل مهاجم و آزمون شناسایی؛
  • آموزش «فدرال» با update قابل خواندن هر مشتری؛
  • TEE بدون attestation بررسی‌شده یا با fallback plaintext؛
  • ادعای همریخت روی تابع بسیار ساده؛
  • DP بدون پارامتر، حسابدار و بودجه؛
  • داده مصنوعی فقط با معیار سودمندی؛
  • پرامپت رمز که در لاگ plaintext کپی می‌شود؛
  • حذف خام و ماندن embedding، checkpoint و backup؛
  • فروشنده PET که همه نقش‌های عدم تبانی را خودش دارد؛
  • ادعایی که خروجی مدل و مجوز ابزار را نادیده می‌گیرد.

راهنمای PET سازمان ICO به‌دلیل تغییر قانون بریتانیا در ۲۰۲۶ در حال بازبینی است. این وضعیت یک اصل را تقویت می‌کند: راهنمای تنظیم‌گر به کشور و تاریخ وابسته است. کنترل فنی باید با کمک متخصص حقوق و حریم به تکلیف جاری نگاشت شود.

دروازه‌های انتشار

پیش از استفاده حساس:

  • هدف، اختیار قانونی، افراد متاثر و استفاده ممنوع مستند باشد؛
  • جریان فیلد و مدل تهدید را حریم، امنیت، حقوق و محصول تأیید کنند؛
  • تلاش کمینه‌سازی پیش از PET پیشرفته اثبات شود؛
  • فرض امنیت و رفتار شکست هر PET صریح باشد؛
  • کلید، attestation، طرف‌ها و بودجه موجودی و پایش شوند؛
  • fallback یا debug نتواند مسیر را دور بزند؛
  • آزمون افشا و سودمندی هر برش خروجی بگذرد؛
  • پارامتر و composition DP با دفتر انتشار سنجیده شود؛
  • تبانی، مسمومیت، بازپخش، rollback و کانال جانبی در صورت ارتباط آزموده شود؛
  • حقوق فرد و حذف، مدل، index، log، backup و فروشنده را پوشش دهد؛
  • بازبینی مستقل یافته بحرانی نداشته باشد؛
  • rollback محاسبه تازه را متوقف و شاهد را حفظ کند.

آستانه عددی را از تهدید و کاربرد بگیرید. اپسیلون، حداقل cohort یا نرخ حمله قابل قبول جهانی وجود ندارد.

پرسش‌های متداول

آیا PET داده را ناشناس می‌کند؟

خودکار نه. برخی طرح‌ها تحت فرض مشخص از ارزیابی ناشناس‌سازی پشتیبانی می‌کنند و برخی فقط exposure را کم یا داده را مستعار می‌کنند. شناسایی‌پذیری را با زمینه و قانون بسنجید.

بهترین PET برای AI چیست؟

هیچ‌کدام همگانی نیست. DP نشت آمار یا آموزش را محدود می‌کند؛ MPC و HE دید ورودی را عوض می‌کنند؛ TEE محاسبه را جدا و فدرال محل داده را تغییر می‌دهد. محاسبه و مهاجم ترکیب را تعیین می‌کنند.

inference روی دستگاه PET است؟

وقتی داده و خروجی کنترل شود معماری تقویت‌کننده حریم است، اما لاگ، backup، update، مجوز و فراخوانی بعدی ابر همچنان مهم‌اند.

آیا ریسک حریم را صفر می‌کنیم؟

برای سامانه مفید ادعای کلی صفر ممکن نیست. تضمین رسمی، فرض پیاده‌سازی، ریسک باقی‌مانده و کنترل عملیاتی را دقیق بگویید.

یادداشت منابع

منابع بررسی‌شده و جاری تا ۳۰ ژوئیه ۲۰۲۶:

#حریم خصوصی#محاسبات محرمانه#حاکمیت هوش مصنوعی#حفاظت داده

مطالب مرتبط

داده مصنوعی با شناسنامه
بینش‌های صنعت

داده مصنوعی با شناسنامه

داده مصنوعی به منشأ، هدف، اعتبارسنجی، کنترل آلودگی و قاعده بازنشستگی نیاز دارد. مصنوعی‌بودن به معنی ناشناس یا بی‌خطر بودن نیست.

ادامه مطلب

ادامه مطالعه

گزارش روزانه و راهنماهای عملیاتی ژرف را ببینید. این صفحه یک آرشیو موضوعی است، نه دعوت به شروع پروژه.