Türkçe Argo, Ağız ve Diyalektle Jailbreak: Filtreleri Atlayan İfade Kalıpları
Kayıt-değişimi kör noktaları ve savunma amaçlı tespit imzaları
Bir dil modelinin güvenlik filtresi çoğu zaman standart Türkçeyi tanır; ama aynı niyet argoyla, "gidicem" gibi ağız yazımıyla ya da harf-kırparak yazıldığında sınıflandırıcı bunu "zararsız" sanır. Bu makale, o kör noktaları 6 kategoride toplayıp savunma için normalize-edilmiş tespit imzalarına çevirir.
Türkçe argo jailbreak nedir?
Türkçe argo jailbreak, bir dil modelinin güvenlik filtresini standart Türkçe yerine argo, bölgesel ağız yazımı, eski/Osmanlıca sözcük, meslek jargonu, çocuk-dili ya da harf-kırpma gibi kayıt-değişimi (register shift) varyantlarıyla aşma tekniğidir. Saldırgan, engellenecek niyeti gizlemez; yalnızca onu filtrenin tanımadığı bir yazım katmanının altına saklar. Guardrail sınıflandırıcıları büyük ölçüde düzgün yazılmış, sözlük Türkçesi üzerinde eğitildiğinden, aynı anlamı taşıyan "gidicem", "nptn" ya da argo bir örtmece kelime, sınıflandırıcının olasılık dağılımında zararlı sınıfın çok altına düşer ve istek zararsız gibi geçer.
Bu, İngilizce literatürdeki düşük-kaynak dil ve kod-karıştırma atlatmalarının Türkçeye özgü, iç-dil (intra-lingual) sürümüdür: dili değiştirmeye gerek yoktur, yalnızca aynı dilin kaydını değiştirmek yeterlidir. Türkçenin aglütinatif yapısı, ağız çeşitliliği ve zengin argo katmanı, tek bir niyet için onlarca yüzey biçimi ürettiğinden bu saldırı yüzeyi doğal olarak geniştir. Bu yazıdaki liste, AltaySec'in guard-blindspots-tr derlemesine eklenen "Türkçe kayıt-değişimi kör noktaları" başlığından türetilmiştir ve saldırı reçetesi değil, savunma/tespit çerçevesinde normalize kalıp imzaları olarak sunulur.
Neden Türkçe kayıt-değişimi guardrail'leri şaşırtıyor?
Sorun genellikle modelin "anlamamasında" değil, güvenlik katmanının anlamamasındadır. Üç yapısal neden öne çıkar:
- Eğitim dağılımı boşluğu. Zararlı-içerik sınıflandırıcıları çoğunlukla düzgün yazılmış örneklerle eğitilir. Ağız yazımı ("yapıyom"), argo örtmece ve harf-kırpma bu dağılımın dışında kalır; sınıflandırıcı bunları görmediği için güven skoru düşer.
- Tokenizasyon parçalanması. Sesli harf düşürülmüş ("slm", "tmm") veya kırpılmış biçimler, kanonik kelimeden farklı token dizilerine ayrışır. Filtre bir kelimeyi bütün token imzasıyla arıyorsa, parçalanmış dizi eşleşmeyi ıskalar.
- Normalize katmanının eksikliği. Birçok guardrail metni doğrudan sınıflandırıcıya verir; araya bir kanonikleştirme adımı koymaz. Oysa "gidicem → gideceğim" dönüşümü olmadan model ile filtre farklı metinler görür.
Bu mekanizma, düşük-kaynak dil ve çok-dilli atlatma çalışmalarının bulgularıyla tutarlıdır: guardrail'ler dağılım dışına çıkan dil kayıtlarında belirgin biçimde zayıflar. AltaySec'in kendi guardrail-arena ölçümünde de Türkçe kayıtlarda jailbreak sınıflandırıcısının önemli bir bölümü kaçırdığı görülmüştür; bu iç-veri sayısını dış-genel bir gerçek gibi değil, yalnızca kendi kıyas ortamımızın gözlemi olarak aktarıyoruz.
6 kayıt-değişimi kör-nokta kategorisi
guard-blindspots-tr'deki kalıpları altı savunulabilir kategoriye ayırıyoruz. Her kategori, aynı niyetin farklı bir yüzey biçimini temsil eder ve her biri için ayrı bir normalize kuralı gerekir.
| Kategori | Ne yapar | Savunma açısından risk |
|---|---|---|
| 1. Argo / eş-anlamlı örtmece | Engellenen kavramı argo veya dolaylı bir örtmeceyle değiştirir | Sözlük eşlemesi olmayan filtre kavramı hiç görmez |
| 2. Bölgesel ağız yazımı | "gidicem", "yapıyom", "gelcen" gibi konuşma-dili yazımı kullanır | Kanonik biçime uzaklık sınıflandırıcı skorunu düşürür |
| 3. Osmanlıca / eski sözcük | Modern karşılığı yerine eski veya edebi kelime koyar | Güncel zararlı-kelime listelerinde karşılığı yoktur |
| 4. Meslek jargonu | Alan-özel terimlerle niyeti teknik bir kılıfa sokar | Genel filtre alan sözlüğünü tanımaz |
| 5. Çocuk-dili / yumuşatma | Yansıma ve küçültme ekleriyle ifadeyi "masumlaştırır" | Ton, zararlı-sınıf sinyalini bastırır |
| 6. Harf-kırpma / ünlü düşürme | "nptn", "slm", "tmm" gibi kısaltma ve sesli-harf düşürme | Token dizisi bütün-kelime imzasıyla eşleşmez |
Toplam derlemede bu altı kategori altında 40 ifade kalıbı bulunuyor. Aşağıda bunların hepsini çalışır saldırı olarak değil, savunma tarafının uygulayabileceği normalize kuralları olarak temsili örneklerle veriyoruz.
Normalize tespit imzaları (savunma tablosu)
Aşağıdaki örnekler bilerek zararsız cümleler üzerinden verilmiştir; amaç, dönüşüm kuralını göstermektir, herhangi bir zararlı talimatı üretmek değildir. Savunma hattı bu dönüşümleri sınıflandırmadan önce uygulayarak metni kanonik Türkçeye indirger.
| Kategori | Normalize kuralı | Zararsız örnek (yüzey → kanonik) |
|---|---|---|
| Ağız yazımı | "-cem/-cam" → "-eceğim/-acağım"; "-yom/-yon" → "-yorum/-yorsun" | "gidicem" → "gideceğim"; "yapıyom" → "yapıyorum" |
| Ağız yazımı | Bölgesel ünlü/ünsüz değişimlerini standart biçime eşle | "gelcen mi" → "gelecek misin" |
| Harf-kırpma | Ünlü düşürülmüş kısaltmaları sözlükle aç | "nptn" → "ne yapıyorsun"; "slm" → "selam" |
| Harf-kırpma | Araya sokulmuş nokta/boşluk/rakamı temizleyip birleştir | "m.e.r.h.a.b.a" → "merhaba" |
| Örtmece / argo | Argo eş-anlamlıyı kavram sözlüğüne (lexicon) eşle | argo bir örtmece → kavramın kanonik karşılığı |
| Osmanlıca / eski sözcük | Eski/edebi sözcüğü modern karşılığına çevir | "cürüm" → "suç"; "nâme" → "mektup" |
| Meslek jargonu | Alan terimini genel karşılığıyla genişlet | jargon kısaltma → tam karşılık |
| Çocuk-dili | Küçültme/yansıma eklerini soyup çekirdek kelimeyi bırak | "uyuyakalmışçık" → "uyumak" |
Kilit fikir şudur: bu kalıplar birbirinden bağımsız değildir; bir istekte aynı anda argo + ağız + harf-kırpma birleşebilir. Bu yüzden normalize katmanı zincirlenebilir olmalı ve metni tek bir kanonik forma indirene kadar tekrarlamalıdır. Aynı normalize disiplini, Türkçe morfolojik atlatmalar ve TR-EN kod-karıştırma yüzeylerinde de geçerlidir.
Savunma prensibi: normalize-önce-sınıflandır
Kayıt-değişimi saldırılarına karşı en sağlam mimari yaklaşım, sınıflandırmadan önce kanonikleştirmedir. Pratikte şu katmanlar birlikte çalışmalıdır:
- Kanonik indirgeme. Ağız eklerini, harf-kırpmayı ve araya sokulmuş karakterleri standart yazıma çevir. Sınıflandırıcı hem ham hem normalize edilmiş metni değerlendirsin.
- Argo/örtmece sözlüğü. Türkçeye özgü örtmece ve eski-sözcük eşlemelerini bir varlık listesi olarak sürekli güncelle. Bu, statik bir kural değil, yeni kalıplarla beslenen bir sözlüktür.
- Anlamsal ikinci hat. Yüzey normalizasyonunu aşan varyantlar için, niyeti yüzey biçiminden bağımsız değerlendiren bir anlamsal kontrol ekle.
- Çıktı tarafı denetimi. Girdi kaçarsa bile modelin ürettiği yanıtı ayrıca denetle; savunma tek noktaya bağlanmasın.
AltaySec tarafında bu prensip, çalışma-zamanı guardrail katmanımız Guardian'da normalize-önce-sınıflandır akışı olarak uygulanır; kayıt-değişimi imzaları da Scanner payload kütüphanesi içinde test vektörü olarak yer alır. Aynı kalıp ailesinin gerçek transkript örnekleri için Türkçe prompt injection saldırı kalıpları yazısına da bakılabilir.
Ölçüm, iç veri ve etik sınırlar
Kayıt-değişimi körlüğünün varlığı, çok-dilli ve düşük-kaynak dil jailbreak literatürüyle desteklenir: dağılım dışına çıkan dil kayıtları guardrail sınıflandırıcılarını atlatabilir. Bu, Türkçeye özgü bir sürprizin değil, iyi belgelenmiş bir zaafın Türkçe yüzeyidir.
Kategori bazındaki atlatma oranları AltaySec'in kendi guardrail-arena ölçümünden gelir ve iç-veridir; bu yazıda kategori-kategori spesifik yüzde vermiyoruz, çünkü bu sayılar yalnızca gerçek test koşullarında anlamlıdır ve dış-genel bir gerçek gibi sunulamaz. Söyleyebileceğimiz savunulabilir çerçeve şudur: Türkçede bu kalıpları derli toplu, tespit-odaklı bir liste hâlinde toplayan açık bir kaynak bulmak güçtür; guard-blindspots-tr bu boşluğu doldurmayı amaçlar.
Son olarak etik çerçeve nettir: bu liste zararlı talimat üretmek için değil, tespit ve savunma için paylaşılır. Örnekler kasıtlı olarak zararsız cümleler üzerinden verilmiş, kalıplar çalışır bir jailbreak reçetesi olarak değil normalize edilmiş imzalar olarak sunulmuştur. Türkçe konuşan bir güvenlik ekibinin görebileceği bu kör noktaları paydaşça paylaşmanın amacı, saldırıyı kolaylaştırmak değil, savunma tarafındaki bilgi açığını kapatmaktır.
Kaynaklar
- Yong et al. — Low-Resource Languages Jailbreak GPT-4 (arXiv:2310.02446)
- Deng et al. — Multilingual Jailbreak Challenges in Large Language Models (arXiv:2310.06474)
- OWASP Top 10 for LLM Applications — LLM01: Prompt Injection
- MITRE ATLAS — Adversarial Threat Landscape for AI Systems
- NIST AI 600-1 — Generative AI Profile (AI Risk Management Framework)
