MITRE ATLAS Türkçe · Taktik Pillar · Savunmadan Kaçınma

Savunmadan Kaçınma (Defense Evasion) — AML.TA0007

MITRE ATLAS Savunmadan Kaçınma taktiği (AML.TA0007): 15 tekniğin Türkçe envanteri, jailbreak ve istem gizleme derin analizi, tespit imzaları ve katmanlı savunma deseni.

Özet: Savunmadan Kaçınma (Defense Evasion, AML.TA0007), bir saldırganın YZ/LLM sistemine yerleştirdiği kötü niyetli girdiyi, davranışı veya bileşeni; insan denetçilerden, guardrail'lardan, model tarayıcılarından ve diğer tespit mekanizmalarından gizleme taktiğidir. MITRE ATLAS bu taktik altında 15 teknik tanımlar (AML.T0015'ten AML.T0111'e): çekişmeli örneklerle model kaçınmasından (AML.T0015), LLM jailbreak (AML.T0054) ve istem gizlemeye (AML.T0068), sahte RAG kaydı enjeksiyonundan (AML.T0071) tedarik zinciri "halı çekme" saldırısına (AML.T0109) kadar. Ortak amaç tek: işlemi yürütmek değil, yürütürken görünmez kalmak.

Türkçe girdilerde kaçınma savunmaları neden daha çok çöküyor

Savunmadan kaçınma tekniklerinin çoğu (özellikle AML.T0054 jailbreak ve AML.T0068 istem gizleme) bir filtre ile modelin girdiyi yorumlaması arasındaki boşlukta yaşar. Bu boşluk Türkçe'de sistematik olarak daha geniştir; üç yapısal neden var:

1. Guardrail'lar ağırlıkla İngilizce eğitilir. Ticari refusal sınıflandırıcıları ve hizalama korumaları büyük oranda İngilizce veri üstünde optimize edilir. Türkçe düşük-kaynak olduğundan reddetme sınırı daha zayıftır ve daha kolay kayar. Aynı jailbreak şablonu İngilizce'de reddedilirken Türkçe çevirisi geçebilir — yani dil kaydırma başlı başına bir kaçınma kanalıdır (AML.T0054).

2. Sondan eklemeli morfoloji, anahtar-kelime kara listelerini patlatır. Türkçe'de tek bir kök yüzlerce yüzey biçim üretir: "unut", "unutuver", "unutsana", "unutmuş ol", "unutturdum". Regex ve kelime listesi tabanlı naif filtreler bu varyant patlamasını kapsayamaz; saldırgan basit bir çekim değişikliğiyle eşleşmeyi kırar.

3. Türkçe casefold ve Unicode köşe durumları normalizasyonu şaşırtır. "İ"/"ı" dönüşümü Türkçe'ye özgü Unicode kuralları taşır; naif lower() çağrıları yanlış sonuç verir ve homoglif havuzu (Kiril, Yunan, Latin-genişletilmiş) Türkçe'ye görsel olarak yakın karakterlerle daha geniş bir saldırı yüzeyi açar (AML.T0068).

AltaySec'in iki-eksenli (EN+TR) guardrail ölçütü guardrail-arena bu boşluğu somut ölçtü: İngilizce eğitilmiş açık bir jailbreak sınıflandırıcısı, Türkçe saldırıların %83'ünü kaçırıyor (veri seti: huggingface.co/datasets/fevziegeyurtsevenler/guardrail-arena). Bunun ikizi bir aşırı-reddetme uçurumudur: saldırıdan yalnızca söz eden zararsız istemler orantısız biçimde bloklanıyor — saldırıları iyi yakalayan yaygın bir dedektör bile bu zorlayıcı (stress) sette istemlerin %40'ını yanlışlıkla engelledi. Yani guardrail ekosistemi bir uçta saldırıyı kaçırıyor, öbür uçta masum kullanıcıyı engelliyor — kaçınma için ideal zemin.

AML.TA0007 teknik envanteri

Aşağıdaki tablo Savunmadan Kaçınma taktiği altındaki 15 tekniğin tümünü Türkçe adı, kısa açıklaması ve yaklaşık OWASP LLM Top 10 (2025) eşlemesiyle listeler. "Kanıt katmanı" sütunu AltaySec dürüstlük rozetini taşır: A = tarayıcıda çalışan görsel simülasyon (canlı lab linki verilir), C = açıklama (gerçek altyapı/model gerektirdiği için tarayıcıda simüle edilemez). OWASP eşlemeleri yaklaşıktır; ATLAS teknikleri OWASP kategorilerinden daha incedir ve bire-bir örtüşmez.

AML.TA0007 Savunmadan Kaçınma — 15 tekniğin Türkçe envanteri (ATLAS içerik sürümü 2026.07). Kanonik roller: kavram bu sayfada, interaktif simülasyon canlı labda.

AML IDTürkçe adAçıklamaOWASP LLM 2025 (yaklaşık)Kanıt katmanı / canlı lab
AML.T0015YZ Modelinden KaçınmaSaldırgan, girdiyi fark edilmez biçimde değiştirerek (çekişmeli örnek) modeli yanlış sınıflandırmaya iter; kötü amaçlı içeriği "zararsız" gösterir.— (çekişmeli-ML)A · canlı lab
AML.T0054LLM Jailbreak (Kısıt Aşımı)Rol yapma, varsayımsal senaryo, jeton parçalama veya kademeli tırmandırma çerçeveleriyle modelin güvenlik/hizalama korumalarını aşar.LLM01 (Prompt Injection / Jailbreak)A · canlı lab
AML.T0067LLM Güvenilir Çıktı Bileşeni ManipülasyonuSahte kaynak atfı, uydurma "doğrulandı" rozeti veya meşru görünümlü link ekleyerek yanıtı kullanıcıya güvenilir gösterip tespitten kaçar.LLM01, LLM09 (Yanlış Bilgi)C · açıklama
AML.T0068LLM İstem GizlemeEngellenen istemi base64, homoglif, sıfır-genişlik karakter veya leetspeak ile gizler; naif filtre kaçırır, model kodu çözüp uygular.LLM01 (Prompt Injection)A · canlı lab
AML.T0071Sahte RAG Kaydı EnjeksiyonuKurbanın RAG veritabanına, belge gibi görünen sahte kayıtlar sokar; sorgu bu kaydı çekince gizli talimat modele ulaşır.LLM08 (Vektör/Gömü Zafiyetleri)C · açıklama
AML.T0073Kimliğe BürünmeGüvenilir bir kişi veya kurum gibi davranarak hedefi kendi adına bir eylem yapmaya ikna eder (ör. LLM destekli oltalama).C · açıklama
AML.T0074Kılık Değiştirme (Meşru Görünüm)Bir yapıtın adını/konumunu meşru veya zararsız göstererek kullanıcı ve güvenlik araçlarını yanıltır.C · açıklama
AML.T0076YZ Model Dosyasını BozmaKötü amaçlı model dosyasını kasıtlı bozarak tarayıcının deserileştirmesini engeller; kod, hata öncesinde çalışmış olabilir.LLM03 (Tedarik Zinciri)C · açıklama
AML.T0081YZ Ajanı Yapılandırmasını DeğiştirmeAjan yapılandırma dosyalarını (sistem istemi, araçlar) değiştirerek kötücül davranışı ajan ömrünün ötesine kalıcı kılar.LLM06 (Aşırı Yetki / Agentic)C · açıklama
AML.T0092Kullanıcı LLM Sohbet Geçmişini Manipüle Etmeİzleri örtmek için kullanıcının sohbet geçmişini değiştirir; kalıcı davranış değişikliklerini veya keşif girişimlerini gizler.LLM01 (dolaylı / bellek)C · açıklama
AML.T0094LLM Yönergelerinin Yürütülmesini GeciktirmeTalimatı gelecekteki bir olaya (anahtar kelime, sonraki etkileşim) bağlar; tetiklenene dek gizli kalarak denetimden kaçar.LLM01 (gecikmeli enjeksiyon)C · açıklama
AML.T0097Sanallaştırma / Kum Havuzu KaçınmasıSanal makine veya analiz ortamı belirtileri arar; kum havuzu tespit ederse davranışını değiştirerek incelemeyi atlatır.C · açıklama
AML.T0107Savunmadan Kaçınmak için Zafiyet SömürüsüBir sistem/uygulama zafiyetini sömürerek güvenlik özelliklerini devre dışı bırakır.C · açıklama
AML.T0109YZ Tedarik Zinciri Halı Çekme (Rug Pull)Önce meşru bir YZ bileşeni yayımlayıp benimsetir, sonra kötücül bir güncelleme iter; ilk incelemeden sonra denetim gevşer.LLM03 (Tedarik Zinciri)C · açıklama
AML.T0111YZ Tedarik Zinciri İtibar Şişirmeİnandırıcı görünen güven sinyalleri (yerleşik hesaplar, yıldız, indirme) üreterek kötücül bileşenin meşruiyetini şişirir.LLM03 (Tedarik Zinciri)C · açıklama

Derin Teknikler: Payload · Tespit · Savunma

AML.T0068

Kavramsal payload örneği: Engellenmesi gereken bir yönerge (ör. kara listede 'önceki talimatları unut'), filtrenin okuyamayacağı ama modelin çözebileceği bir biçime sokulur. Dört kanal: (1) kodlama — yönerge base64/hex/URL-encode ile sarılır; (2) homoglif — Latin harfler görsel ikizleriyle değiştirilir (Kiril 'о','е','а'), 'sistem' karışık-alfabeli 'siсtеm' olur; (3) sıfır-genişlikli karakter — kelime aralarına U+200B enjekte edilir, metin görünürde bütün ama bayt düzeyinde parçalı; (4) leetspeak/boşluk — a→4, e→3, i→1 veya harf-arası boşluk. Kavramsal örnek savunma amaçlıdır; çalışan zararlı payload verilmez.

Tespit imzası: Ham girdi ile NFKC-normalize edilmiş girdi arasında eşik-üstü Levenshtein farkı; tek kelime içinde çoklu Unicode script karışımı (Latin+Kiril); yüksek-entropili base64 blokları; sıfır-genişlik/görünmez kod noktalarının varlığı.

Savunma deseni: Filtreyi ham metne değil normalleştirilmiş metne uygula: sırayla NFKC normalize → sıfır-genişlik at → homoglif geri-eşle → base64/leet çöz → sonra niyet sınıflandır. Canlı demo bu 'kodlayıcı vs sertleştirilmiş filtre' karşıtlığını tarayıcıda gösterir: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068

AML.T0054

Kavramsal payload örneği: Modelin güvenlik hizası ve guardrail'ları istemle aşılır. Çerçeveler: rol yapma ('kısıtsız bir asistanı canlandır'), varsayımsal/kurgu kabuğu ('bir romanda karakter şöyle derdi...'), jeton veya hece parçalama, çok turda zararsızdan yasaklıya kademeli tırmandırma. Türkçe'ye özgü zafiyet: hizalama ağırlıkla İngilizce yapıldığından aynı şablon İngilizce'de reddedilirken Türkçe çevirisi geçebilir — dil kaydırma başlı başına bir bypass kanalıdır. Kalıp savunma için teşhir edilir; çalışan zararlı içerik üretilmez.

Tespit imzası: Anahtar kelime değil niyet: girdi-tarafı refusal-classifier + çıktı-tarafı içerik sınıflandırması; çok-turlu oturumda semantik-sürüklenme (konu zararsızdan yasaklıya kayıyor mu); 'sen artık / rol / varsayımsal / kısıtsız' kalıplarının dil-agnostik gömü uzayında tespiti.

Savunma deseni: İki kapılı savunma — girdi-tarafı niyet sınıflandırma + çıktı-tarafı güvenlik filtresi; guardrail'ı çok-dilli, özellikle Türkçe jailbreak korpusuyla (AltaySec/turkish-llm-injection) eğit. Canlı lab: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0054

AML.T0067

Kavramsal payload örneği: Saldırgan istemle modelin yanıtının bileşenlerini — sahte kaynak atıfları, uydurma 'doğrulandı ✓' rozetleri, meşru görünümlü markdown linkleri, sahte sistem-ibareleri — kullanıcıya güvenilir göstermek için biçimlendirir. Amaç yürütmek değil; kurbanın ortamında fark edilmeden kalmaya devam etmek ve kullanıcı denetiminden kaçmaktır. Örnek: dolaylı enjeksiyonla ele geçirilmiş bir ajan, yanıtına 'Kaynak: resmi belge (doğrulandı)' gibi sahte güven sinyalleri iliştirerek uydurma bir talimatı meşrulaştırır.

Tespit imzası: Çıktıdaki tüm URL/atıfların sunucu-tarafı beyaz liste doğrulaması; modelin ürettiği 'system/verified/doğrulandı' türü meta-ibarelerin işaretlenmesi; alıntı ile gösterilen kaynak arasında tutarsızlık.

Savunma deseni: Güven sinyallerini (linkler, alıntılar, rozetler) modele ürettirme; bunları uygulama katmanında doğrulanmış kaynaktan üret ve UI'da 'model tarafından üretildi' etiketiyle ayır. Gerçek altyapı gerektirdiği için AltaySec'te C-katmanı (açıklama) rozetiyle işaretlidir. Referans: https://atlas.mitre.org/techniques/AML.T0067

Sık Sorulan Sorular

Savunmadan Kaçınma taktiği (AML.TA0007) nedir?

MITRE ATLAS'ın YZ sistemlerine yönelik taktiklerinden biridir. Saldırganın; kötü niyetli girdisini, davranışını veya yerleştirdiği bileşeni insan denetçilerden, LLM guardrail'larından, model tarayıcılarından ve diğer tespit mekanizmalarından gizlemesini kapsar. Amaç eylemi yürütmek değil, yürütürken fark edilmeden kalmaktır. Altında 15 teknik bulunur (AML.T0015'ten AML.T0111'e).

Türkçe girdilerde jailbreak neden daha kolay geçiyor?

Üç yapısal nedenle: (1) refusal/hizalama korumaları ağırlıkla İngilizce eğitildiğinden Türkçe'de reddetme sınırı daha zayıftır; (2) sondan eklemeli morfoloji tek kökten yüzlerce yüzey biçim üretip anahtar-kelime kara listelerini kırar; (3) Türkçe casefold ve homoglif köşe durumları naif normalizasyonu şaşırtır. AltaySec'in iki-eksenli guardrail-arena ölçümünde, İngilizce eğitilmiş açık bir jailbreak sınıflandırıcısı Türkçe saldırıların %83'ünü kaçırdı (github.com/fevziegeyurtsevenler/guardrail-arena).

İstem gizlemeyi (AML.T0068) nasıl tespit ederim?

Dört imza etkilidir: ham girdi ile NFKC-normalize edilmiş girdi arasında eşik-üstü fark; tek kelime içinde birden fazla Unicode script karışımı (ör. Latin+Kiril); metin gövdesinde yüksek-entropili base64 blokları; sıfır-genişlikli/görünmez kod noktalarının varlığı. Filtreyi ham metne değil normalleştirilmiş metne uygulayın. Karşıtlığı tarayıcıda görmek için: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068

Bu teknikleri deneyebileceğim canlı lab var mı?

Evet. AML.T0015 (Model Kaçınması), AML.T0054 (Jailbreak) ve AML.T0068 (İstem Gizleme) için tarayıcıda çalışan görsel simülasyonlar mevcuttur (dürüstlük rozeti A). Diğer 12 teknik gerçek altyapı gerektirdiği için açıklama katmanındadır (rozet C). Lablar: https://fevziegeyurtsevenler.github.io/altaysec-atlas/#/t/AML.T0068

Bu teknikler OWASP LLM Top 10 ile nasıl eşleşir?

Yaklaşık olarak: jailbreak ve istem gizleme (AML.T0054, AML.T0068) LLM01 Prompt Injection; sahte RAG kaydı (AML.T0071) LLM08; tedarik zinciri teknikleri (AML.T0076, AML.T0109, AML.T0111) LLM03; ajan yapılandırma manipülasyonu (AML.T0081) LLM06. ATLAS teknikleri OWASP kategorilerinden daha incedir; eşlemeler bire-bir değildir.

ATLAS™, The MITRE Corporation'ın ticari markasıdır. Bu içerik bağımsız eğitim amaçlıdır; MITRE ile bağlı veya onun tarafından onaylı değildir. Teknik tanımlar resmî MITRE ATLAS bilgi tabanına dayanır (Apache-2.0), atıf korunur.