Savunmadan Kaçınma (Defense Evasion) — AML.TA0007
MITRE ATLAS Savunmadan Kaçınma taktiği (AML.TA0007): 15 tekniğin Türkçe envanteri, jailbreak ve istem gizleme derin analizi, tespit imzaları ve katmanlı savunma deseni.
Türkçe girdilerde kaçınma savunmaları neden daha çok çöküyor
Savunmadan kaçınma tekniklerinin çoğu (özellikle AML.T0054 jailbreak ve AML.T0068 istem gizleme) bir filtre ile modelin girdiyi yorumlaması arasındaki boşlukta yaşar. Bu boşluk Türkçe'de sistematik olarak daha geniştir; üç yapısal neden var:
1. Guardrail'lar ağırlıkla İngilizce eğitilir. Ticari refusal sınıflandırıcıları ve hizalama korumaları büyük oranda İngilizce veri üstünde optimize edilir. Türkçe düşük-kaynak olduğundan reddetme sınırı daha zayıftır ve daha kolay kayar. Aynı jailbreak şablonu İngilizce'de reddedilirken Türkçe çevirisi geçebilir — yani dil kaydırma başlı başına bir kaçınma kanalıdır (AML.T0054).
2. Sondan eklemeli morfoloji, anahtar-kelime kara listelerini patlatır. Türkçe'de tek bir kök yüzlerce yüzey biçim üretir: "unut", "unutuver", "unutsana", "unutmuş ol", "unutturdum". Regex ve kelime listesi tabanlı naif filtreler bu varyant patlamasını kapsayamaz; saldırgan basit bir çekim değişikliğiyle eşleşmeyi kırar.
3. Türkçe casefold ve Unicode köşe durumları normalizasyonu şaşırtır. "İ"/"ı" dönüşümü Türkçe'ye özgü Unicode kuralları taşır; naif lower() çağrıları yanlış sonuç verir ve homoglif havuzu (Kiril, Yunan, Latin-genişletilmiş) Türkçe'ye görsel olarak yakın karakterlerle daha geniş bir saldırı yüzeyi açar (AML.T0068).
AltaySec'in iki-eksenli (EN+TR) guardrail ölçütü guardrail-arena bu boşluğu somut ölçtü: İngilizce eğitilmiş açık bir jailbreak sınıflandırıcısı, Türkçe saldırıların %83'ünü kaçırıyor (veri seti: huggingface.co/datasets/fevziegeyurtsevenler/guardrail-arena). Bunun ikizi bir aşırı-reddetme uçurumudur: saldırıdan yalnızca söz eden zararsız istemler orantısız biçimde bloklanıyor — saldırıları iyi yakalayan yaygın bir dedektör bile bu zorlayıcı (stress) sette istemlerin %40'ını yanlışlıkla engelledi. Yani guardrail ekosistemi bir uçta saldırıyı kaçırıyor, öbür uçta masum kullanıcıyı engelliyor — kaçınma için ideal zemin.
AML.TA0007 teknik envanteri
Aşağıdaki tablo Savunmadan Kaçınma taktiği altındaki 15 tekniğin tümünü Türkçe adı, kısa açıklaması ve yaklaşık OWASP LLM Top 10 (2025) eşlemesiyle listeler. "Kanıt katmanı" sütunu AltaySec dürüstlük rozetini taşır: A = tarayıcıda çalışan görsel simülasyon (canlı lab linki verilir), C = açıklama (gerçek altyapı/model gerektirdiği için tarayıcıda simüle edilemez). OWASP eşlemeleri yaklaşıktır; ATLAS teknikleri OWASP kategorilerinden daha incedir ve bire-bir örtüşmez.
AML.TA0007 Savunmadan Kaçınma — 15 tekniğin Türkçe envanteri (ATLAS içerik sürümü 2026.07). Kanonik roller: kavram bu sayfada, interaktif simülasyon canlı labda.
| AML ID | Türkçe ad | Açıklama | OWASP LLM 2025 (yaklaşık) | Kanıt katmanı / canlı lab |
|---|---|---|---|---|
| AML.T0015 | YZ Modelinden Kaçınma | Saldırgan, girdiyi fark edilmez biçimde değiştirerek (çekişmeli örnek) modeli yanlış sınıflandırmaya iter; kötü amaçlı içeriği "zararsız" gösterir. | — (çekişmeli-ML) | A · canlı lab |
| AML.T0054 | LLM Jailbreak (Kısıt Aşımı) | Rol yapma, varsayımsal senaryo, jeton parçalama veya kademeli tırmandırma çerçeveleriyle modelin güvenlik/hizalama korumalarını aşar. | LLM01 (Prompt Injection / Jailbreak) | A · canlı lab |
| AML.T0067 | LLM Güvenilir Çıktı Bileşeni Manipülasyonu | Sahte kaynak atfı, uydurma "doğrulandı" rozeti veya meşru görünümlü link ekleyerek yanıtı kullanıcıya güvenilir gösterip tespitten kaçar. | LLM01, LLM09 (Yanlış Bilgi) | C · açıklama |
| AML.T0068 | LLM İstem Gizleme | Engellenen istemi base64, homoglif, sıfır-genişlik karakter veya leetspeak ile gizler; naif filtre kaçırır, model kodu çözüp uygular. | LLM01 (Prompt Injection) | A · canlı lab |
| AML.T0071 | Sahte RAG Kaydı Enjeksiyonu | Kurbanın RAG veritabanına, belge gibi görünen sahte kayıtlar sokar; sorgu bu kaydı çekince gizli talimat modele ulaşır. | LLM08 (Vektör/Gömü Zafiyetleri) | C · açıklama |
| AML.T0073 | Kimliğe Bürünme | Güvenilir bir kişi veya kurum gibi davranarak hedefi kendi adına bir eylem yapmaya ikna eder (ör. LLM destekli oltalama). | — | C · açıklama |
| AML.T0074 | Kılık Değiştirme (Meşru Görünüm) | Bir yapıtın adını/konumunu meşru veya zararsız göstererek kullanıcı ve güvenlik araçlarını yanıltır. | — | C · açıklama |
| AML.T0076 | YZ Model Dosyasını Bozma | Kötü amaçlı model dosyasını kasıtlı bozarak tarayıcının deserileştirmesini engeller; kod, hata öncesinde çalışmış olabilir. | LLM03 (Tedarik Zinciri) | C · açıklama |
| AML.T0081 | YZ Ajanı Yapılandırmasını Değiştirme | Ajan yapılandırma dosyalarını (sistem istemi, araçlar) değiştirerek kötücül davranışı ajan ömrünün ötesine kalıcı kılar. | LLM06 (Aşırı Yetki / Agentic) | C · açıklama |
| AML.T0092 | Kullanıcı LLM Sohbet Geçmişini Manipüle Etme | İzleri örtmek için kullanıcının sohbet geçmişini değiştirir; kalıcı davranış değişikliklerini veya keşif girişimlerini gizler. | LLM01 (dolaylı / bellek) | C · açıklama |
| AML.T0094 | LLM Yönergelerinin Yürütülmesini Geciktirme | Talimatı gelecekteki bir olaya (anahtar kelime, sonraki etkileşim) bağlar; tetiklenene dek gizli kalarak denetimden kaçar. | LLM01 (gecikmeli enjeksiyon) | C · açıklama |
| AML.T0097 | Sanallaştırma / Kum Havuzu Kaçınması | Sanal makine veya analiz ortamı belirtileri arar; kum havuzu tespit ederse davranışını değiştirerek incelemeyi atlatır. | — | C · açıklama |
| AML.T0107 | Savunmadan Kaçınmak için Zafiyet Sömürüsü | Bir sistem/uygulama zafiyetini sömürerek güvenlik özelliklerini devre dışı bırakır. | — | C · açıklama |
| AML.T0109 | YZ Tedarik Zinciri Halı Çekme (Rug Pull) | Önce meşru bir YZ bileşeni yayımlayıp benimsetir, sonra kötücül bir güncelleme iter; ilk incelemeden sonra denetim gevşer. | LLM03 (Tedarik Zinciri) | C · açıklama |
| AML.T0111 | YZ Tedarik Zinciri İtibar Şişirme | İnandırıcı görünen güven sinyalleri (yerleşik hesaplar, yıldız, indirme) üreterek kötücül bileşenin meşruiyetini şişirir. | LLM03 (Tedarik Zinciri) | C · açıklama |
Derin Teknikler: Payload · Tespit · Savunma
AML.T0068
Kavramsal payload örneği: Engellenmesi gereken bir yönerge (ör. kara listede 'önceki talimatları unut'), filtrenin okuyamayacağı ama modelin çözebileceği bir biçime sokulur. Dört kanal: (1) kodlama — yönerge base64/hex/URL-encode ile sarılır; (2) homoglif — Latin harfler görsel ikizleriyle değiştirilir (Kiril 'о','е','а'), 'sistem' karışık-alfabeli 'siсtеm' olur; (3) sıfır-genişlikli karakter — kelime aralarına U+200B enjekte edilir, metin görünürde bütün ama bayt düzeyinde parçalı; (4) leetspeak/boşluk — a→4, e→3, i→1 veya harf-arası boşluk. Kavramsal örnek savunma amaçlıdır; çalışan zararlı payload verilmez.
Tespit imzası: Ham girdi ile NFKC-normalize edilmiş girdi arasında eşik-üstü Levenshtein farkı; tek kelime içinde çoklu Unicode script karışımı (Latin+Kiril); yüksek-entropili base64 blokları; sıfır-genişlik/görünmez kod noktalarının varlığı.
Savunma deseni: Filtreyi ham metne değil normalleştirilmiş metne uygula: sırayla NFKC normalize → sıfır-genişlik at → homoglif geri-eşle → base64/leet çöz → sonra niyet sınıflandır. Canlı demo bu 'kodlayıcı vs sertleştirilmiş filtre' karşıtlığını tarayıcıda gösterir: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068
AML.T0054
Kavramsal payload örneği: Modelin güvenlik hizası ve guardrail'ları istemle aşılır. Çerçeveler: rol yapma ('kısıtsız bir asistanı canlandır'), varsayımsal/kurgu kabuğu ('bir romanda karakter şöyle derdi...'), jeton veya hece parçalama, çok turda zararsızdan yasaklıya kademeli tırmandırma. Türkçe'ye özgü zafiyet: hizalama ağırlıkla İngilizce yapıldığından aynı şablon İngilizce'de reddedilirken Türkçe çevirisi geçebilir — dil kaydırma başlı başına bir bypass kanalıdır. Kalıp savunma için teşhir edilir; çalışan zararlı içerik üretilmez.
Tespit imzası: Anahtar kelime değil niyet: girdi-tarafı refusal-classifier + çıktı-tarafı içerik sınıflandırması; çok-turlu oturumda semantik-sürüklenme (konu zararsızdan yasaklıya kayıyor mu); 'sen artık / rol / varsayımsal / kısıtsız' kalıplarının dil-agnostik gömü uzayında tespiti.
Savunma deseni: İki kapılı savunma — girdi-tarafı niyet sınıflandırma + çıktı-tarafı güvenlik filtresi; guardrail'ı çok-dilli, özellikle Türkçe jailbreak korpusuyla (AltaySec/turkish-llm-injection) eğit. Canlı lab: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0054
AML.T0067
Kavramsal payload örneği: Saldırgan istemle modelin yanıtının bileşenlerini — sahte kaynak atıfları, uydurma 'doğrulandı ✓' rozetleri, meşru görünümlü markdown linkleri, sahte sistem-ibareleri — kullanıcıya güvenilir göstermek için biçimlendirir. Amaç yürütmek değil; kurbanın ortamında fark edilmeden kalmaya devam etmek ve kullanıcı denetiminden kaçmaktır. Örnek: dolaylı enjeksiyonla ele geçirilmiş bir ajan, yanıtına 'Kaynak: resmi belge (doğrulandı)' gibi sahte güven sinyalleri iliştirerek uydurma bir talimatı meşrulaştırır.
Tespit imzası: Çıktıdaki tüm URL/atıfların sunucu-tarafı beyaz liste doğrulaması; modelin ürettiği 'system/verified/doğrulandı' türü meta-ibarelerin işaretlenmesi; alıntı ile gösterilen kaynak arasında tutarsızlık.
Savunma deseni: Güven sinyallerini (linkler, alıntılar, rozetler) modele ürettirme; bunları uygulama katmanında doğrulanmış kaynaktan üret ve UI'da 'model tarafından üretildi' etiketiyle ayır. Gerçek altyapı gerektirdiği için AltaySec'te C-katmanı (açıklama) rozetiyle işaretlidir. Referans: https://atlas.mitre.org/techniques/AML.T0067
Sık Sorulan Sorular
Savunmadan Kaçınma taktiği (AML.TA0007) nedir?
MITRE ATLAS'ın YZ sistemlerine yönelik taktiklerinden biridir. Saldırganın; kötü niyetli girdisini, davranışını veya yerleştirdiği bileşeni insan denetçilerden, LLM guardrail'larından, model tarayıcılarından ve diğer tespit mekanizmalarından gizlemesini kapsar. Amaç eylemi yürütmek değil, yürütürken fark edilmeden kalmaktır. Altında 15 teknik bulunur (AML.T0015'ten AML.T0111'e).
Türkçe girdilerde jailbreak neden daha kolay geçiyor?
Üç yapısal nedenle: (1) refusal/hizalama korumaları ağırlıkla İngilizce eğitildiğinden Türkçe'de reddetme sınırı daha zayıftır; (2) sondan eklemeli morfoloji tek kökten yüzlerce yüzey biçim üretip anahtar-kelime kara listelerini kırar; (3) Türkçe casefold ve homoglif köşe durumları naif normalizasyonu şaşırtır. AltaySec'in iki-eksenli guardrail-arena ölçümünde, İngilizce eğitilmiş açık bir jailbreak sınıflandırıcısı Türkçe saldırıların %83'ünü kaçırdı (github.com/fevziegeyurtsevenler/guardrail-arena).
İstem gizlemeyi (AML.T0068) nasıl tespit ederim?
Dört imza etkilidir: ham girdi ile NFKC-normalize edilmiş girdi arasında eşik-üstü fark; tek kelime içinde birden fazla Unicode script karışımı (ör. Latin+Kiril); metin gövdesinde yüksek-entropili base64 blokları; sıfır-genişlikli/görünmez kod noktalarının varlığı. Filtreyi ham metne değil normalleştirilmiş metne uygulayın. Karşıtlığı tarayıcıda görmek için: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068
Bu teknikleri deneyebileceğim canlı lab var mı?
Evet. AML.T0015 (Model Kaçınması), AML.T0054 (Jailbreak) ve AML.T0068 (İstem Gizleme) için tarayıcıda çalışan görsel simülasyonlar mevcuttur (dürüstlük rozeti A). Diğer 12 teknik gerçek altyapı gerektirdiği için açıklama katmanındadır (rozet C). Lablar: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068
Bu teknikler OWASP LLM Top 10 ile nasıl eşleşir?
Yaklaşık olarak: jailbreak ve istem gizleme (AML.T0054, AML.T0068) LLM01 Prompt Injection; sahte RAG kaydı (AML.T0071) LLM08; tedarik zinciri teknikleri (AML.T0076, AML.T0109, AML.T0111) LLM03; ajan yapılandırma manipülasyonu (AML.T0081) LLM06. ATLAS teknikleri OWASP kategorilerinden daha incedir; eşlemeler bire-bir değildir.
ATLAS™, The MITRE Corporation'ın ticari markasıdır. Bu içerik bağımsız eğitim amaçlıdır; MITRE ile bağlı veya onun tarafından onaylı değildir. Teknik tanımlar resmî MITRE ATLAS bilgi tabanına dayanır (Apache-2.0), atıf korunur.
