Guardrail Mühendisliği · MLSecOps

Llama Guard vs NeMo Guardrails vs Guardrails AI vs Guardian
Aynı test setinde EN ve TR performansı yan yana

Dört guardrail'i tek bir iki eksenli test setinde ölçtük. İngilizce benchmark'lardaki sıralama Türkçe'de olduğu gibi geçerli değil — çünkü hazır jailbreak sınıflandırıcıları Türkçe saldırıların büyük bir kısmını fark etmeden geçiriyor.

Guardrail nedir ve neden dört aracı karşılaştırıyoruz?

Guardrail (koruma bandı), bir LLM uygulamasının giriş ve çıkışını çalışma zamanında denetleyen, zararlı/kural dışı içeriği modele ulaşmadan veya kullanıcıya dönmeden önce yakalayan güvenlik katmanıdır. Modelin kendisini değiştirmez; onun etrafına bir filtre, doğrulayıcı ve akış yöneticisi yerleştirir. Prompt injection, PII sızıntısı, jailbreak, halüsinasyon ve politika ihlali gibi riskleri model dışı bir kontrol noktasında ele alır.

Piyasada en sık adı geçen dört seçenek üç farklı mimari sınıfına ait: Llama Guard bir sınıflandırıcı model, NeMo Guardrails bir orkestrasyon çerçevesi, Guardrails AI bir doğrulama kütüphanesi/firewall, Guardian ise AltaySec'in hibrit LLM firewall'u. Bunları yan yana koymak istememizin nedeni basit: mevcut karşılaştırmaların neredeyse tamamı İngilizce benchmark'lara dayanıyor ve Türkçe bir uygulamada hangisinin gerçekten koruduğunu gösteren kamuya açık bir Türkçe kaynak neredeyse yok.

Çıkar çatışması beyanı: Guardian AltaySec'in kendi ürünüdür. Aşağıdaki Türkçe ölçümler de AltaySec guardrail-arena iç test setinden gelmektedir; bağımsız bir benchmark değildir. Bu yüzden Guardian'ın öne çıktığı eksenlerde ölçüm yöntemini açıkça gösteriyor, diğer üç aracın Türkçe davranışını yalnızca gerçekten test edilen sonuçlarla aktarıyoruz.

Dört aracın kimliği: aynı işi yapmıyorlar

Karşılaştırmanın en yaygın hatası, dördünü aynı kutuya koymaktır. Oysa mimari olarak farklı katmanlardalar ve çoğu zaman birbirini tamamlarlar.

Llama Guard — safe/unsafe sınıflandırıcı

Meta'nın açık ağırlıklı güvenlik modelidir. Girdiyi (ve isteğe bağlı çıktıyı) bir güvenlik taksonomisine göre safe / unsafe olarak etiketler. Akışı yönetmez, bir karar döndürür; kararın ne yapacağına uygulama karar verir. Düşük gecikmeli, tek amaçlı bir bileşendir.

NeMo Guardrails — Colang tabanlı orkestrasyon

NVIDIA'nın çerçevesidir. Colang adı verilen bir diyalog-akış diliyle giriş, çıkış, konu ve içerik güvenliği "rail"leri tanımlanır; jailbreak ve prompt injection azaltımı bu rail'lerin içine gömülüdür. Önemli nokta: NeMo, içerik güvenliği rail'inde Llama Guard'ı bir sınıflandırıcı olarak çağırabilir — yani ikisi rakip değil, biri diğerinin motoru olabilir.

Guardrails AI — doğrulama katmanı / LLM firewall

Girdi ve çıktıyı bir dizi doğrulayıcıdan (validator) geçiren Python odaklı bir kütüphanedir: PII tespiti, injection kontrolü, halüsinasyon/şema doğrulama gibi. Yapılandırılmış çıktı garantisi ve programatik kontrol isteyen ekipler için güçlüdür.

Guardian — hibrit LLM firewall (AltaySec)

AltaySec'in ürünüdür; kural tabanlı + ML hibrit bir yaklaşımla Türkçe'ye özel injection ve KVKK/PII vektörlerine odaklanır. Bu makalede karşılaştırmaya, yalnızca Türkçe eksenini göstermek için ve yöntemi açıkça beyan ederek dahil edilmiştir.

İki eksenli karşılaştırma tablosu

Aşağıdaki tablo mimari sınıfı, İngilizce güç profilini, Türkçe doğrulama durumunu ve operasyonel maliyeti özetler. Türkçe sütunundaki değerlendirmeler AltaySec guardrail-arena iç test setine (iki eksenli: zararlı-yakalama + zararsız-reddetme) dayanır; sayısal skorlar yalnızca gerçekten ölçülen agregada verilir, tekil araca uydurma yüzde atanmaz.

AraçMimari sınıfıEN benchmark profiliTürkçe doğrulama (iç ölçüm)Gecikme / kurulum
Llama GuardSınıflandırıcı modelGüçlü, olgunHazır sınıflandırıcı grubunda; Türkçe agregada zayıf (aşağıya bakınız)Düşük gecikme / model barındırma gerekir
NeMo GuardrailsOrkestrasyon çerçevesiEsnek, güçlü akış kontrolüRail motoruna bağlı; Türkçe için ayrı kural/sınıflandırıcı yazılması şartOrta-yüksek gecikme / Colang öğrenme eğrisi
Guardrails AIDoğrulama kütüphanesiYapılandırılmış çıktı/PII'de güçlüValidator'lar İngilizce merkezli; Türkçe injection'da ek doğrulayıcı gerekirOrta gecikme / Python entegrasyonu kolay
Guardian (AltaySec)Hibrit firewallKamuya açık EN benchmark'ı yokTürkçe injection/KVKK için tasarlandı; iç sette daha yüksek yakalamaOrta gecikme / on-prem kurulabilir

Not: Gecikme ve kurulum sütunları mimari sınıfından çıkarılan niteliksel karşılaştırmalardır; ortam bağımlı milisaniye değerleri iddia edilmemiştir.

Merkezi bulgu: hazır sınıflandırıcılar Türkçe'de kör noktalı

Karşılaştırmanın alıntılanabilir çekirdeği tek cümlede özetlenebilir: AltaySec guardrail-arena iç ölçümünde hazır jailbreak sınıflandırıcıları Türkçe saldırıların yaklaşık %83'ünü kaçırdı. Bu, aynı iki eksenli test setinde (zararlı istekleri yakalama ekseni + zararsız istekleri gereksiz reddetme ekseni) İngilizce ve Türkçe varyantların yan yana koşturulmasıyla elde edildi.

Bunun anlamı, benchmark tablolarının okunma biçimini değiştirir: İngilizce'deki sıralama Türkçe'de olduğu gibi geçerli değildir. Bir aracın İngilizce Jailbreak Bench'te üstte olması, aynı saldırının Türkçe morfolojik varyantını, kod-karıştırma (TR-EN) veya "çeviri bahanesi" gibi kalıpları yakalayacağını garanti etmez. Sınıflandırıcı, ağırlıklı olarak İngilizce zararlı örneklerle eğitildiği için Türkçe yüzeyde kör nokta üretir.

Kaynak ve tekrarüretilebilirlik için: bu ölçüm bir dış benchmark değil, AltaySec guardrail-arena açık test setinin bir sürümüdür ve iki eksenli protokolü ile birlikte yayımlanır. Sonucu "bağımsız akademik benchmark" gibi değil, tekrar üretilebilir bir iç ölçüm olarak okuyun.

'Türkçe destekliyor' iddiası: pazarlama mı, gerçek mi?

Dört aracın çoğunun dokümantasyonu "çok dilli" veya "Türkçe dahil" ifadeleri içerir. Ancak bir guardrail için "dili destekliyor" iki farklı anlama gelir: (1) girdiyi teknik olarak işleyebilmek, (2) o dildeki saldırıyı gerçekten yakalayabilmek. İkincisi test edilmeden birincisi güvenlik anlamı taşımaz.

Bu yüzden metodolojik kural şudur: bir aracın Türkçe'de "kaçırdığını" ancak onu gerçekten Türkçe saldırı setiyle test ettikten sonra söyleriz. guardrail-arena'nın iki eksenli protokolü tam da bunu yapar — aynı payload'ın İngilizce ve Türkçe sürümünü aynı araca verip yakalama farkını ölçer. Test edilmemiş bir aracın Türkçe davranışı hakkında "başarısız" demek de en az abartılı "destekliyor" iddiası kadar yanıltıcıdır.

Pratik çıkarım: hangi aracı seçerseniz seçin, üretime almadan önce kendi Türkçe saldırı kalıplarınızla — morfolojik varyant, TR-EN kod karıştırma, kültürel manipülasyon, çeviri bahanesi — bir kabul testi koşturun. "Türkçe destekliyor" satırı bu testin yerine geçmez.

Adversarial baskı altında F1 neden düşüyor?

Türkçe kör noktanın ötesinde, guard modellerinin genel bir zafiyeti daha var: baskı altında bozulma. Bağımsız değerlendirmelerde guard modellerinin F1 skoru, saldırgan girdiler ve uzun bağlam altında belirgin biçimde düşüyor. Örneğin bir değerlendirmede Jailbreak Bench üzerinde ~0.796 F1 elde eden bir yapılandırma, uzun-bağlam senaryosunda 0.602 F1'e geriliyor.

Bu iki gözlemi birleştirdiğimizde savunma mühendisliği için net bir prensip çıkar: tek katmanlı guardrail yeterli değildir. Bir sınıflandırıcı (Llama Guard) hızlı bir ilk süzgeçtir; ama uzun bağlamda ve Türkçe varyantlarda tek başına bırakılırsa boşluk verir. NeMo gibi bir orkestrasyon katmanı, giriş rail'i + içerik güvenliği rail'i + çıkış rail'ini üst üste koyarak bu tek nokta arızasını azaltır. Guardrails AI ise çıktı tarafında şema/PII doğrulamasıyla farklı bir kör noktayı kapatır.

Dolayısıyla doğru soru "hangisi en iyi?" değil, "hangi kombinasyon benim tehdit modelimi kapatıyor?" sorusudur.

Nasıl seçmeli? Karar rehberi

Aşağıdaki eşleştirme, mimari sınıflarını gerçek ihtiyaca bağlar:

  • Sadece hızlı bir içerik güvenlik kararı istiyorsanız: Llama Guard tek başına yeterli bir başlangıç sınıflandırıcısıdır — ancak Türkçe kabul testini mutlaka ekleyin.
  • Çok adımlı diyalog akışını yönetmek, konu sınırlaması ve rail zinciri kurmak istiyorsanız: NeMo Guardrails; ve içerik güvenliği rail'inde Llama Guard'ı motor olarak çağırın.
  • Yapılandırılmış çıktı garantisi, PII maskeleme ve şema doğrulama önceliğinizse: Guardrails AI çıkış tarafında güçlüdür.
  • Türkçe injection ve KVKK/PII odaklı, on-prem bir firewall arıyorsanız: Guardian (AltaySec) bu senaryo için tasarlandı — ama seçiminizi kendi verinizle doğrulayın; çıkar çatışması beyanımız gereği bunu bağımsız test etmenizi öneririz.

Genel savunma mühendisliği önerisi: bunları rakip değil katman olarak düşünün. Giriş sınıflandırıcısı + akış orkestrasyonu + çıkış doğrulaması üst üste bindiğinde, tek bir aracın Türkçe kör noktası ya da uzun-bağlam F1 düşüşü sistemin tamamını çökertmez.

Kaynaklar

İlgili Yazılar