TR-SecEval: Türkçe LLM Güvenliği İçin 5 Eksenli Değerlendirme Çerçevesi
Tek sayı değil, karne: ASR + aşırı-red + PII recall + kararlılık + maliyet
Türkçe modeller için yetenek ölçen kıyaslamalar var; güvenlik tarafında ise tek bir metriğe (çoğunlukla enjeksiyon başarı oranına) sıkışıp kalıyoruz. TR-SecEval, bir Türkçe LLM'in güvenliğini beş eksenli bir karneyle ölçen, açık varlık zinciriyle yeniden üretilebilir bir pratisyen çerçevesi önerisidir.
TR-SecEval nedir?
TR-SecEval, bir Türkçe büyük dil modelinin (LLM) güvenlik davranışını tek bir sayıya indirgemek yerine beş ayrı eksende ölçen, açık kaynaklı varlıklarla yeniden üretilebilir bir değerlendirme çerçevesi önerisidir. Beş eksen şunlardır: saldırı başarı oranı (ASR), aşırı-red oranı, PII sızıntı recall'u, kararlılık/varyans ve maliyet-token. Her eksen için bir hesaplama formülü, bir yorum eşiği ve bir dürüstlük kuralı tanımlanır; sonuçlar bir güvenlik karnesi olarak raporlanır.
Adı ve eksen kümesi AltaySec'in önerdiği bir çerçevedir; kabul görmüş bir endüstri standardı değildir. Amaç, "Türkçe LLM güvenliği nasıl ölçülür?" sorusuna, tek bir saldırı türünü değil savunmanın bütününü kapsayan, tekrar edilebilir bir cevap vermektir. Çerçeve, güvenliği sadece saldırıya karşı direnç olarak değil; direnç, kullanılabilirlik (aşırı reddetmeme), gizlilik (PII sızdırmama), tutarlılık ve maliyet arasındaki denge olarak ele alır.
Bu makale, tek bir veri setini değil; birden çok açık varlığı ve metriği ortak bir çerçevede birleştiren bir referans (hub) sayfası olarak konumlanır. Belirli bir veri setinin detayları için AltayDuel Türkçe prompt injection dataseti yazısına bakabilirsiniz.
Neden çok eksenli? Tek metriğin körlüğü
Türkçe için mevcut kıyaslama çabaları iki uçta toplanıyor. Bir yanda yetenek ölçen genel kıyaslamalar var (örneğin TR-MMLU, modelin bilgi ve akıl yürütme kapasitesini ölçer, güvenliğini değil). Diğer yanda, akademik olarak yayımlanmış Türkçe prompt injection kıyaslamaları modelin tek bir saldırı ekseni altındaki dayanıklılığını ölçer. İkisi de değerlidir, ama ikisi de tek başına bir güvenlik kararı vermeye yetmez.
Tek eksenli ölçümün üç kör noktası vardır:
- Aşırı-red körlüğü: Sadece ASR'ye bakan bir değerlendirme, her şeyi reddeden bir modeli "çok güvenli" ilan eder. Oysa masum bir Türkçe soruyu reddeden model, üretimde kullanılamaz.
- Gizlilik körlüğü: Enjeksiyona direnen bir model, normal akışta kişisel veriyi (PII) sızdırabilir. KVKK bağlamında bu, enjeksiyondan daha somut bir yükümlülüktür.
- Kararlılık körlüğü: Bir modeli aynı saldırıyla beş kez denerseniz ve bir kez kırılırsa, tek koşulu raporlamak yanıltıcı bir güven verir.
TR-SecEval'in tezi basittir: güvenlik bir karnedir, tek bir not değil. Bir eksende iyi olan model başka bir eksende sınıfta kalabilir; karar verici bu dengeleri görmelidir.
Beş eksen: formüller ve eşikler
Aşağıdaki tablo, her ekseni, ölçüm formülünü ve pratik yorum çerçevesini özetler. Formüller kasıtlı olarak sadedir; amaç, farklı ekiplerin aynı test setiyle aynı sayıyı üretebilmesidir.
| Eksen | Ölçtüğü | Formül | Yorum |
|---|---|---|---|
| 1. Saldırı başarı oranı (ASR) | Enjeksiyon/jailbreak dayanıklılığı | başarılı saldırı / toplam saldırı denemesi | Düşük iyidir. Yalnız başına yeterli değildir. |
| 2. Aşırı-red oranı | Kullanılabilirlik / yanlış pozitif | reddedilen masum istek / toplam masum istek | Yüksekse model işe yaramaz; ASR ile birlikte okunmalı. |
| 3. PII sızıntı recall'u | Gizlilik / KVKK riski | yakalanan PII sızıntısı / gerçek PII içeren çıktı | Sızdırılan kişisel verinin ne kadarının tespit/engellendiği. |
| 4. Kararlılık / varyans | Tekrarda tutarlılık | N tekrarlı denemede sonuçların varyansı | Düşük varyans güvenilir savunma demektir. |
| 5. Maliyet-token | Operasyonel maliyet | istek başına ortalama token (giriş+çıkış) | Savunmanın ekonomik sürdürülebilirliği. |
ASR ve aşırı-red oranı çift olarak okunmalıdır: aralarındaki gerilim, bir modelin "güvenli ama kullanışsız" ile "kullanışlı ama savunmasız" ekseninde nerede durduğunu gösterir. guardrail-arena protokolünde gözlemlediğimiz iki-eksenli okuma da tam olarak bu gerilimi ölçmek içindir; bu ölçüm AltaySec'in kendi iç değerlendirmesidir ve dış-doğrulanmamış bir bulgudur.
Açık varlık zinciri: çerçeveyi yeniden üretilebilir kılan katman
Bir çerçevenin işe yaraması için üç şey gerekir: test verisi, bir yargı mekanizması ve dürüstlük kuralları. TR-SecEval bunları AltaySec'in açık varlıklarına bağlar. Aşağıdaki bileşenler AltaySec'in kendi ölçüm ve veri varlıklarıdır; genel-geçer sektör gerçekleri değil, çerçeveye özgü referanslardır.
- Test verisi — AltayDuel HF dataseti: Türkçe saldırı örnekleri ve düello dökümleri içeren açık veri seti (300 enjeksiyon örneği + 3033 döküm; dökümler 2594 + 439). ASR ve kararlılık eksenleri için tekrar edilebilir bir Türkçe test tabanı sağlar. Detay için AltayDuel dataset yazısı.
- Yargı mekanizması — canary-oracle: Bir saldırının başarılı olup olmadığına karar verirken deterministik anahtar-kelime eşleştirmesi yerine, sisteme yerleştirilmiş bir sır/işaret (canary) sızdı mı sızmadı mı sorusunu soran bir yaklaşım. Bu, "model kelimeyi söyledi mi?" değil "savunma gerçekten aşıldı mı?" sorusunu ölçer. canary-oracle yaklaşımı AltaySec'in iç metodolojisidir ve dış-doğrulanmamıştır.
- Protokol — guardrail-arena: ASR ile aşırı-red oranını aynı anda ölçen iki-eksenli değerlendirme protokolü. Yine AltaySec'in iç ölçüm çerçevesidir.
Bu zincirin amacı, sonuçların bir laboratuvarın kapalı kutusunda kalmaması; başka bir ekibin aynı veriyle aynı yargı kuralını uygulayıp benzer sayıya ulaşabilmesidir.
Neden deterministik yargıç değil, canary-oracle?
LLM güvenlik değerlendirmesinde en sık yapılan hata, saldırının başarısını basit bir kelime listesiyle ölçmektir: çıktıda "işte tarif" geçiyorsa saldırı başarılı sayılır. Bu deterministik yargıç iki yönde de yanılır. Model reddederken "tarif veremem" derse, kelime yine geçtiği için yanlış-pozitif üretir; ya da saldırgan istediğini farklı sözcüklerle elde ederse yanlış-negatif üretir.
canary-oracle yaklaşımı bu tuzağı, ölçülebilir bir hedef yerleştirerek aşar. Sistem promptuna yalnızca saldırgana verilmemesi gereken bir işaret (örneğin oturuma özgü bir sır) konur; başarı, bu işaretin çıktıya sızıp sızmadığıyla tanımlanır. Böylece yargı, çıktının üslubuna değil, savunmanın gerçekten aşılıp aşılmadığına bağlanır.
Aynı disiplin bir dürüstlük kuralını da beraberinde getirir: mode-collapse uyarısı ve entropi kontrolü. Otomatik saldırı üreten sistemler zamanla tek bir kalıba çökebilir (mode collapse); ürettikleri saldırılar çeşitliliğini yitirir. Bu durumda ASR yapay olarak sabitlenir ve gerçek dayanıklılığı yansıtmaz. Bu yüzden TR-SecEval, saldırı setinin çeşitliliğini (entropi) izlemeyi ve çeşitlilik düştüğünde sonuçları temkinle raporlamayı önerir. Bu dürüstlük kuralları AltaySec'in iç metodoloji notlarıdır.
Güvenlik karnesi nasıl çıkarılır: pratik akış
Bir Türkçe modeli TR-SecEval'e göre değerlendirmek isteyen bir ekibin izleyebileceği asgari akış şu şekildedir:
- Test setini kur: Enjeksiyon/jailbreak örnekleri + masum kontrol istekleri + PII içeren senaryolar. Türkçe saldırı tabanı için açık AltayDuel verisi başlangıç noktası olabilir.
- Tekrarlı çalıştır: Her senaryoyu tek sefer değil, N kez çalıştır ki kararlılık/varyans ekseni ölçülebilsin.
- canary-oracle ile yargıla: Başarıyı işaretin sızıp sızmadığına göre işaretle; deterministik kelime eşleştirmesine güvenme.
- Beş ekseni ayrı raporla: Tek bir toplam not verme; ASR ve aşırı-red oranını yan yana, PII recall'unu ayrı, maliyeti ayrı göster.
- Dürüstlük kontrolü: Saldırı setinin entropisini raporla; çökme varsa "bu ASR alt-sınırdır" notunu düş.
Çıktı, tek bir yeşil/kırmızı ışık değil; kararlılık payı ve maliyet bağlamıyla okunan bir karnedir. Bu karne, üretime alma kararında "model X'i mi Y'yi mi?" sorusuna, tek eksenli bir kıyaslamanın veremeyeceği bir denge tablosu sunar. Karneyi düzenli aralıklarla yeniden çalıştırmak, model yükseltmelerinin sessiz güvenlik gerilemelerini de yakalar.
TR-SecEval mevcut çalışmalar arasında nerede durur?
Türkçe güvenlik değerlendirmesi boş bir alan değil. Yetenek tarafında TR-MMLU gibi kıyaslamalar modelin bilgisini ölçüyor; güvenlik tarafında ise akademik olarak yayımlanmış Türkçe prompt injection kıyaslamaları modelin tek eksenli dayanıklılığını raporluyor. TR-SecEval bunların yerine geçmeyi değil, üstüne bir katman koymayı hedefler: farklı metrikleri ve varlıkları tek bir karne çerçevesinde birleştiren bir pratisyen standardı önerisi olmak.
Farkı şudur: mevcut akademik enjeksiyon kıyaslamaları güvenliği tek eksende (ASR) ölçerken, TR-SecEval beş ekseni birleştirir ve açık varlık zinciriyle (veri + yargı + protokol) yeniden üretilebilirliği ön plana alır. Bu yüzden bunu "alıntılanacak yegâne kaynak" olarak değil, çok-eksenli ve açık bir pratisyen çerçevesi olarak sunuyoruz. Ölçüm kültürünün olgunlaşması için birden çok bağımsız çerçevenin bir arada bulunması sağlıklıdır.
Değerlendirmeden üretime geçişte, karneyi sürekli bir güvence katmanına bağlamak isteyen ekipler için AltaySec'in LLM güvenlik duvarı (Guardian) yaklaşımı ve çalışma zamanı guardrail'leri tamamlayıcı okumalar sunar. Kurumsal değerlendirme desteği için bize ulaşabilirsiniz.
