Adversarial Machine Learning Nedir?
Saldırı türleri, ATLAS eşlemesi ve Türkçe taksonomi
Çekişmeli makine öğrenmesi, bir modeli kasıtlı hazırlanmış girdilerle yanıltmayı, bozmayı veya içindeki bilgiyi çekip çıkarmayı hedefleyen saldırı-savunma disiplinidir. Türkçe kaynaklarda bu kavram sıklıkla üretici ağlarla (GAN) karıştırıldığı için, bu yazıda dört ana saldırı sınıfını ayrıştırıyor ve her birini MITRE ATLAS taktikleriyle eşliyoruz.
Adversarial Machine Learning Nedir? (Tanım)
Adversarial machine learning (çekişmeli makine öğrenmesi), bir makine öğrenmesi modelinin davranışını, kasıtlı olarak hazırlanmış girdiler aracılığıyla saldırganın istediği yöne çevirmeyi amaçlayan saldırı ve savunma tekniklerinin tümüdür. Buradaki "çekişme" (adversarial), modelin normal koşullarda doğru çalıştığı halde; insan gözüne sıradan görünen ama modelin karar sınırını manipüle etmek için özenle üretilmiş girdilerle yanıltılabilmesini anlatır. Amaç modeli çalışma anında yanıltmak, eğitim aşamasında bozmak, kopyalamak veya içindeki gizli bilgiyi sızdırmak olabilir.
Kavramın klasik örneği, bir görüntü sınıflandırıcısına verilen ve insan gözüyle değişmemiş görünen ancak piksellerine hesaplanmış küçük bir gürültü eklenmiş fotoğraftır; model bu "adversarial örnek" karşısında panda yerine jibon der. Bu 2010'ların ortasına ait görsel örnek, alanı popülerleştirdi. Ne var ki 2026'da tehdit yüzeyi çok daha geniştir: dil modelleri, öneri sistemleri, dolandırıcılık tespiti, RAG mimarileri ve otonom ajanların hepsi çekişmeli saldırıların kapsamındadır.
Neden Türkçe'de Kafa Karışıklığı Var: GAN vs Güvenlik
Türkçe arama sonuçlarında "adversarial" kelimesi neredeyse tamamen Generative Adversarial Networks (üretici çekişmeli ağlar, GAN) bağlamına kayar. GAN, iki sinir ağının (üretici ve ayırt edici) birbiriyle yarıştırıldığı bir üretim mimarisidir; sahte görüntü/ses üretmek için kullanılır. Bu, güvenlik anlamındaki adversarial ML'den tamamen farklı bir konudur.
Güvenlik bağlamındaki adversarial machine learning ise bir tehdit disiplinidir: mevcut bir modeli hedef alan saldırıları ve bunlara karşı savunmayı inceler. İki kavramın "adversarial" kelimesini paylaşması, Türkçe teknik içerikte kalıcı bir karışıklığa yol açmıştır. Bu yazıda yalnızca güvenlik anlamını, yani modele yönelik saldırı taksonomisini ele alıyoruz. Temel kavram netleştirmesi için Türkçe yapay zeka güvenliği sözlüğümüze de bakabilirsiniz.
Adversarial ML 4'lüsü: Türkçe Taksonomi
NIST'in çekişmeli makine öğrenmesi terminolojisi ve raporu (NIST AI 100-2), saldırıları saldırganın amacına göre dört ana sınıfta toplar. Aşağıdaki tablo, bu standart dört sınıfı Türkçe adlandırmalarıyla, MITRE ATLAS taktik karşılıklarıyla ve LLM çağındaki güncel görünümleriyle birlikte veriyor. Taksonominin kendisi NIST kaynaklıdır; buradaki katkımız, sınıfları Türkçe adlandırıp güncel LLM saldırılarıyla tek tabloda eşlemektir.
| Sınıf (TR / EN) | Saldırganın amacı | ATLAS taktik karşılığı | LLM-çağı karşılığı |
|---|---|---|---|
| Kaçırma / Evasion | Modeli çalışma anında yanlış çıktı vermeye zorlamak | Savunma Kaçırma, ML Saldırı Hazırlığı | Jailbreak, prompt injection, güvenlik filtresini atlatma |
| Zehirleme / Poisoning | Eğitim verisini veya model ağırlıklarını kalıcı biçimde bozmak | Eğitim Verisini Zehirleme, ML Tedarik Zinciri Ele Geçirme | Veri seti enjeksiyonu, RAG doküman zehirleme, arka kapı |
| Çıkarma / Extraction | Modeli, parametreleri veya sistem davranışını kopyalamak/çalmak | Sızdırma, ML Model Çalma | Model distilasyonuyla kopyalama, sistem promptu sızdırma |
| Çıkarım / Inference | Eğitim verisi hakkında gizli bilgi sızdırmak | ML Çıkarım API'si üzerinden sızdırma | Ezberlenmiş veri sızıntısı, üyelik/öznitelik çıkarımı, PII ifşası |
Bu dört sınıf birbirini dışlamaz; gerçek bir kampanya birden fazlasını zincirleyebilir. Örneğin bir saldırgan önce çıkarma saldırısıyla modelin karar sınırını öğrenip ardından bu bilgiyle daha isabetli kaçırma girdileri üretebilir.
ATLAS Eşlemesi: Predictive AI ve Generative AI Ayrımı
MITRE ATLAS, gerçek dünyadaki yapay zeka saldırılarını taktik ve tekniklere ayıran bir bilgi tabanıdır; ATT&CK çerçevesinin makine öğrenmesi sistemlerine uyarlanmış halidir. ATLAS'ın veri modeli, taktik ve teknikleri hangi sistem türüne ait olduklarına göre platform etiketleriyle işaretler. Bu ayrım, savunmacılar için kritiktir çünkü iki geniş sistem sınıfının tehdit yüzeyi farklıdır:
- Öngörücü yapay zeka (Predictive AI): Sınıflandırma, regresyon, öneri ve anomali tespiti gibi görevler. Klasik adversarial örnekler, veri zehirleme ve model çalma saldırıları burada yoğunlaşır.
- Üretici yapay zeka (Generative AI): Büyük dil modelleri ve çok kipli üretim sistemleri. Prompt injection, jailbreak, dolaylı enjeksiyon ve ajan kötüye kullanımı bu etikete düşer.
ATLAS'ın veri formatı sürüm 6.0.0 seviyesine ulaşmış olsa da, yayımlanan matris sürümü ayrı ilerler; sürüm etiketini kesin bir sayı olarak değil, düzenli güncellenen bir bilgi tabanı olarak okumak doğru olur. Türkçe içerikte bu öngörücü/üretici ayrımı neredeyse hiç işlenmediği için, bir saldırıyı ATLAS taktiğine eşlerken önce hangi sistem sınıfıyla uğraştığınızı belirlemek gerekir. ATLAS ile OWASP LLM Top 10 arasındaki köprü için OWASP LLM Top 10 Türkçe rehberimize bakabilirsiniz.
LLM Çağında Klasik Saldırıların Yeni Yüzleri
Adversarial ML'in dört klasik sınıfı, dil modelleri çağında ortadan kalkmadı; kılık değiştirdi. Bu süreklilik, savunmacılar için önemli bir zihinsel araçtır: yeni gördüğünüz bir LLM saldırısı, büyük olasılıkla eski bir sınıfın yeni bir tezahürüdür.
- Kaçırma → Jailbreak ve prompt injection. Görüntüye eklenen gürültünün yerini artık rol yaptırma, çeviri bahanesi, kodlama/obfuskasyon ve morfolojik bükme gibi metinsel manipülasyonlar aldı. Mekanizma aynıdır: modeli, karar sınırının yanlış tarafına düşürecek bir girdi kurmak. Kaçırmanın metinsel biçimleri için prompt injection nedir yazımız temel referanstır.
- Zehirleme → Veri seti ve RAG enjeksiyonu. Eğitim verisine kötü niyetli örnek sokmak; ya da bir RAG mimarisinin çektiği dokümanlara talimat gömerek modeli erişim anında bozmak. Dolaylı enjeksiyon, zehirlemenin çalışma zamanına taşınmış halidir.
- Çıkarma → Model kopyalama ve sistem promptu sızdırma. Bir modele yeterince sorgu göndererek davranışını taklit eden bir kopya eğitmek; ya da gizli sistem talimatını dışarı sızdırmak. İkincisi, üretici sistemlerde sık görülen ve tek başına ciddi bir gizlilik ihlali olan bir çıkarma biçimidir.
- Çıkarım → Ezberlenmiş veri ve PII sızıntısı. Modelin eğitim sırasında ezberlediği hassas verinin uygun sorgularla geri çekilmesi. KVKK açısından bu, en yüksek riskli sınıflardan biridir.
Savunma Prensipleri
Çekişmeli saldırılara karşı tek bir sihirli kalkan yoktur; savunma katmanlı olmak zorundadır. Sınıf bazında birkaç temel prensip:
- Kaçırmaya karşı: Girdi ve çıktı denetimi, çalışma zamanı korumaları ve saldırı simülasyonuyla sürekli test. AltaySec'in yapay zeka güvenlik duvarı yaklaşımı olan Guardian, tam da bu kaçırma yüzeyini üretim anında filtrelemeye odaklanır.
- Zehirlemeye karşı: Veri kökeni (provenance) ve model imzalama, eğitim ve erişim verisinin bütünlüğünü doğrulamak; tedarik zinciri denetimi.
- Çıkarmaya karşı: Sorgu hızı sınırlama, sistem promptunun sağlamlaştırılması ve API erişiminin izlenmesi.
- Çıkarıma karşı: Diferansiyel gizlilik teknikleri, çıktı maskeleme ve eğitim verisinden hassas içeriğin ayıklanması.
Ortak nokta şudur: savunmayı tasarlarken önce saldırıyı doğru sınıfa yerleştirin. Yanlış sınıf teşhisi, yanlış kontrolün seçilmesine yol açar.
AltaySec Kaynakları ve Sonuç
Çekişmeli makine öğrenmesi, 2010'ların panda görselinden ibaret bir merak değil; 2026'nın kurumsal yapay zeka yığınının her katmanını ilgilendiren aktif bir tehdit disiplinidir. Dört klasik sınıfı (kaçırma, zehirleme, çıkarma, çıkarım) tanımak, bugünün LLM saldırılarını da eski bir haritanın üzerinde okumanızı sağlar.
AltaySec tarafında, bu kavramları uygulamalı olarak inceleyebileceğiniz iki açık kaynak vardır. ai-security-glossary, buradaki terimlerin Türkçe tanımlarını içerir. guardrail-arena ise özellikle kaçırma (evasion) sınıfına dair somut örnekler barındırır; AltaySec'in kendi ölçümleri, jailbreak sınıflandırıcılarının Türkçe girdilerde belirgin biçimde daha çok kaçırma yaşadığını göstermiştir. Bu, morfolojik olarak zengin dillerin kaçırma yüzeyini genişlettiğine dair somut bir örnektir. Türkçe saldırı örneklerini derlediğimiz AltayDuel veri setine ve alanın giriş kapısı olan LLM güvenliği nedir yazımıza da göz atmanızı öneririz. Kurumunuzun modellerini bu dört sınıfa karşı test etmek isterseniz bizimle iletişime geçebilirsiniz.
