Model Extraction, Model Inversion ve Membership Inference
Üç model hırsızlığı saldırısı, tek tabloda ayrıştırıldı
Bir modele doğrudan erişiminiz olmadan onu kopyalayabilir, eğitim verisini geri kurabilir ve belirli bir kişinin verisinin eğitimde kullanılıp kullanılmadığını ispatlayabilirsiniz. Bu üç saldırı — model extraction, model inversion ve membership inference — Türkçe kaynaklarda birbirine karıştırılır. Bu yazı üçünü hedef varlık, saldırgan bilgisi, KVKK sonucu ve MITRE ATLAS teknik ID'si eksenlerinde ayrıştırıyor.
Üç Saldırı Nedir? Tek Paragraflık Tanım
Model extraction (model çalma), bir makine öğrenmesi modelini yalnızca çıkarım API'sine sorgu göndererek ve dönen cevapları etiket olarak kullanarak fonksiyonel bir kopyasını — literatürdeki adıyla vekil modeli (substitute model) — eğitme saldırısıdır. Model inversion (model tersine çevirme), modelin çıktılarını (güven skorları, olasılık vektörleri) tersine işleyerek modelin öğrendiği eğitim verisini ya da bir girdinin hassas özelliklerini geri kurma saldırısıdır. Membership inference (üyelik çıkarımı) ise belirli bir veri kaydının modelin eğitim setinde bulunup bulunmadığını, modelin o kayda verdiği tepkideki istatistiksel izlerden yola çıkarak tespit etme saldırısıdır. Üçü de modelin kendisine dosya olarak erişmeyi gerektirmez; sadece API üzerinden sorgu yapabilmek yeterlidir. Bu yüzden her biri, bir model üretime açıldığı anda — hiçbir sunucu ele geçirilmeden — gerçekleşebilen çıkarım-zamanı (inference-time) tehditleridir.
Bu üç terim ilk bakışta "modelden bilgi sızdırma" başlığı altında birbirine benzer; ancak hedef varlıkları farklıdır: extraction modelin kendisini, inversion eğitim verisini, membership inference ise tek bir kaydın eğitimdeki varlığını hedefler. Karışıklığın önüne geçmek için bu ayrımı en baştan netleştirmek gerekir.
Model Extraction: Modeli Sorgulayarak Kopyalamak
Model extraction saldırısında saldırgan, hedef modele bir dizi girdi gönderir, dönen çıktıları toplar ve bu (girdi, çıktı) çiftlerini bir eğitim seti gibi kullanarak kendi modelini eğitir. Yeterli sorgu bütçesiyle ortaya çıkan vekil model, orijinalin karar sınırlarını yüksek doğrulukla taklit eder. Saldırganın amacı genellikle ikisinden biridir: fikri mülkiyeti çalmak (aylarca süren eğitim ve etiketleme maliyetini birkaç bin sorguyla ele geçirmek) veya çalınan vekil model üzerinde beyaz kutu saldırıları geliştirip bunları orijinale transfer etmek.
Büyük dil modelleri çağında bu saldırının yeni bir biçimi damıtma tarzı çalmadır: pahalı bir modelin çıktılarıyla daha küçük bir modeli eğitmek. Buradaki teknik sınır incedir — yasal model damıtma ile izinsiz model çalma arasındaki fark, sorgulanan modelin kullanım koşulları ve sözleşmesidir. OWASP Makine Öğrenmesi Güvenliği Top 10 listesinde bu saldırı ML05:2023 Model Theft başlığıyla yer alır.
Uygulama katmanında belirtiler tanıdıktır: tek bir istemciden gelen yüksek hacimli, sistematik ve girdi uzayını tarayan sorgu desenleri. Bu yüzden extraction, ağırlıklı olarak bir oran sınırlama ve anomali tespiti problemidir; tek bir sorgu masumdur, saldırgan olan sorgu dağılımıdır.
Model Inversion: Çıktıdan Eğitim Verisini Geri Kurmak
Model inversion, modelin bir girdiye verdiği güven skorlarını veya olasılık dağılımını kaldıraç olarak kullanır. Saldırgan, "model şu sınıfa en yüksek güveni hangi girdide veriyor?" sorusunu optimizasyon problemine çevirir ve modeli, temsil ettiği eğitim verisine benzeyen bir girdi üretecek şekilde "tersine" çalıştırır. Klasik örnek, bir yüz tanıma modelinden yalnızca kişinin adı ve model çıktıları üzerinden o kişinin yüzüne benzeyen bir görüntü yeniden oluşturmaktır.
Dil modelleri bağlamında inversion, ezberlenmiş eğitim metinlerinin geri çekilmesi biçiminde ortaya çıkar: uygun istemlerle model, eğitim korpusunda gördüğü metin parçalarını — telefon numaraları, adresler, özel yazışmalar — kelimesi kelimesine üretebilir. Bu, saf bir üretim gücü değil, bir ezberleme sızıntısıdır ve doğrudan gizlilik ihlaline dönüşür. arXiv üzerindeki 2024 tarihli model inversion literatür taraması (2411.10023) bu saldırının teknik çeşitlerini derli toplu ele alır. OWASP listesinde karşılığı ML03:2023 Model Inversion Attack'tir.
Inversion'un extraction'dan farkı hedeftedir: extraction modelin davranışını, inversion modelin hafızasındaki veriyi hedefler. Bir saldırgan çalınmış bir vekil model üzerinde inversion çalıştırarak iki saldırıyı zincirleyebilir.
Membership Inference: Bir Kaydın Eğitimde Olup Olmadığını İspatlamak
Membership inference, üç saldırının en "cerrahi" olanıdır. Saldırgan bütün eğitim setini geri kurmaya çalışmaz; yalnızca elindeki tek bir kayıt için tek bir soruya cevap arar: Bu kayıt bu modelin eğitiminde kullanıldı mı? Yöntemin temeli, modellerin gördükleri örneklere görmediklerinden farklı — genellikle daha "kendinden emin" — tepki vermesidir. Bu güven farkı ölçülebilir bir sinyaldir; saldırgan bu sinyali eşikleyerek üyeliği tahmin eder. ScienceDirect'teki güncel derleme (S2949715924000064) bu saldırı ailesini ayrıntılı işler; OWASP karşılığı ML04:2023 Membership Inference Attack'tir.
Bu saldırı düşük hacimli veri sızdırır ama yüksek etkilidir. Modelin eğitim seti hassas bir popülasyona aitse — örneğin belirli bir hastalığın teşhis modeli, bir kredi risk modeli ya da bir ceza tekrar tahmin modeli — "eğitimde vardı" cevabının kendisi, kişi hakkında hassas bir çıkarımdır. Bu nedenle membership inference'ı bir hacim değil, bağlam problemi olarak değerlendirmek gerekir.
Karşılaştırma Tablosu ve KVKK Karşılıkları
Üç saldırıyı dört eksende ayrıştırdığımızda tablo netleşir. KVKK sütunu, bu terimlerin Türkçe hukuki karşılığını — sıkça atlanan bir bağı — açıkça ortaya koyar.
| Eksen | Model Extraction | Model Inversion | Membership Inference |
|---|---|---|---|
| Hedef varlık | Modelin kendisi (karar sınırları) | Eğitim verisi / girdi özellikleri | Tek bir kaydın eğitimdeki varlığı |
| Saldırganın bilgisi | Yalnızca API erişimi (kara kutu) | Çıktı olasılıkları / güven skorları | Sorgulanacak aday kayıt + model tepkisi |
| Sızan bilginin türü | Fikri mülkiyet (model ağırlıklarının işlevsel kopyası) | Hassas eğitim içeriği (yüz, metin, PII) | Üyelik bilgisi (evet/hayır) |
| KVKK sonucu | Doğrudan kişisel veri ihlali değil; fikri mülkiyet/ticari sır kaybı | Kişisel verinin ifşası (Madde 12 veri güvenliği ihlali) | Kişisel verinin eğitimde işlendiğinin ispatı — açık rıza/hukuki dayanak sorgusunu tetikler |
| MITRE ATLAS ID | AML.T0024.002 (Extract AI Model) | AML.T0024.001 (Invert AI Model) | AML.T0024.000 (Infer Training Data Membership) |
KVKK açısından en sık gözden kaçan bağ, membership inference'ınkidir. Türkçe kaynaklarda "üyelik çıkarımı"nın hukuki karşılığı neredeyse hiç yazılmamıştır: bu saldırı başarılı olduğunda ortaya çıkan sonuç, bir kişisel verinin belirli bir modelin eğitiminde kullanıldığının ispatıdır. Bu ispat tek başına, veri sorumlusuna yönelik "bu veriyi hangi hukuki sebeple işlediniz, açık rıza var mıydı?" sorusunu gündeme getirir. Yani membership inference, bir güvenlik açığı olduğu kadar bir uyum (compliance) delili üretme aracıdır. KVKK ve LLM kesişimini daha geniş ele aldığımız KVKK ve LLM güvenliği yazısı bu çerçeveyi tamamlar.
MITRE ATLAS Haritası: Neden Üçü de AML.T0024?
MITRE ATLAS, yapay zeka sistemlerine yönelik saldırıları ATT&CK mantığıyla taktik ve tekniklere ayıran referans çerçevesidir. Bu üç saldırının tek bir üst teknik altında toplanması tesadüf değildir: üçü de Exfiltration (sızdırma) taktiği kapsamında, modelin çıkarım API'si üzerinden gerçekleşir. Üst teknik AML.T0024 — Exfiltration via ML Inference API'dir ve üç alt teknik olarak dallanır:
- AML.T0024.000 — Infer Training Data Membership: membership inference
- AML.T0024.001 — Invert AI Model: model inversion
- AML.T0024.002 — Extract AI Model: model extraction / model theft
Bu haritalama pratikte işe yarar: bir tehdit modellemesi yaparken "modelimiz internete açık bir çıkarım API'si sunuyor mu?" sorusunun cevabı "evet" ise, AML.T0024 ve üç alt tekniği otomatik olarak kapsam içindedir. ATLAS'ın gerçek dünya vaka çalışmaları, bu tekniklerin akademik bir merak olmadığını; üretim ortamlarındaki modellere karşı uygulanabilir olduğunu gösterir. Terimlerin kanonik Türkçe tanımlarını AltaySec AI güvenlik sözlüğü deposunda derliyoruz; bu yazı, o sözlüğün üç terimlik bir açılımı olarak da okunabilir.
Savunma Prensipleri: Üç Saldırıya Üç Katman
Bu üç saldırının ortak zemini — hepsinin çıkarım API'si üzerinden çalışması — savunmayı da belirler. Tek bir sihirli çözüm yoktur; katmanlı bir yaklaşım gerekir:
- Extraction'a karşı — çıkış katmanı ve hız: Oran sınırlama, sorgu bütçesi izleme ve tek istemciden gelen sistematik tarama desenlerini yakalayan anomali tespiti. Güven skorlarını ham vektör olarak değil, yuvarlanmış veya yalnızca en yüksek etiket olarak döndürmek, saldırganın kopyalayabileceği sinyali azaltır.
- Inversion'a karşı — gizlilik korumalı eğitim: Diferansiyel gizlilik (differential privacy) ile eğitim, modelin tek tek örnekleri ezberlemesini sınırlar; çıktı güven skorlarını kısıtlamak tersine-optimizasyonu zorlaştırır.
- Membership inference'a karşı — genelleme ve düzenlileştirme: Aşırı öğrenmeyi (overfitting) azaltan düzenlileştirme, eğitim ve test örnekleri arasındaki güven farkını — yani saldırının kullandığı sinyali — daralttığı için doğrudan savunmadır. Diferansiyel gizlilik burada da geçerlidir.
Uygulama önündeki bir LLM güvenlik duvarı katmanı — bizim tarafımızda Guardian — bu savunmanın çıkarım-zamanı bileşenini üstlenir: anormal sorgu hacmini ve girdi uzayını tarayan desenleri modelin önünde durdurmak, extraction ve inversion'ı ekonomik olarak zorlaştırır. Model imzalama ve köken (provenance) uygulamalarını ise ayrı bir yazıda ele aldık. Kurumsal bir değerlendirme için bizimle iletişime geçebilirsiniz.
Sonuç olarak bu üç terim sinonim değil, bir saldırı ailesidir: aynı kapıdan (çıkarım API'si) giren, ama farklı varlıkları hedefleyen üç ayrı teknik. Doğru savunma, önce doğru ayrımdan geçer.
Kaynaklar
- MITRE ATLAS — AML.T0024: Exfiltration via ML Inference API
- MITRE ATLAS — AML.T0024.002: Extract AI Model
- MITRE ATLAS — AML.T0024.000: Infer Training Data Membership
- Model Inversion Attacks: A Survey (arXiv 2411.10023)
- Membership Inference Attacks — A Survey (ScienceDirect S2949715924000064)
- OWASP ML05:2023 Model Theft
- OWASP ML03:2023 Model Inversion Attack
- OWASP ML04:2023 Membership Inference Attack
- AltaySec AI Güvenlik Sözlüğü (ai-security-glossary)
