Best-of-N Jailbreak: Otomatik Varyant Üretimiyle Guardrail Yorma
Örnekleme bütçesi bir saldırı parametresine dönüştüğünde savunma tarafı ne yapmalı
Best-of-N jailbreak, tek bir zekice payload aramaz; aynı zararlı isteğin yüzlerce-binlerce ufak varyantını üretip birini tutana kadar örnekler. Saldırı artık bir fikir değil, bir bütçe kalemidir — ve bu bütçenin Türkçe'de kamuya açık bir ölçümü henüz yok.
Best-of-N jailbreak nedir?
Best-of-N (BoN) jailbreak, tek ve kusursuz bir kaçış cümlesi aramak yerine, aynı zararlı isteğin küçük yüzey değişiklikleriyle üretilmiş N adet varyantını modele bağımsız olarak örnekleyip, bunlardan en az biri guardrail'i geçtiği anda başarı sayan örnekleme tabanlı bir saldırı yöntemidir. Buradaki mantık istatistikseldir: modelin ve guardrail'in davranışı deterministik olmadığı için, semantik olarak aynı ama biçimsel olarak farklı yeterince çok deneme yapılırsa savunmanın bir gedikten geçme olasılığı birikir.
Yöntem akademik olarak Best-of-N Jailbreaking başlığıyla tanımlandı (arXiv 2412.03556, NeurIPS 2025 poster). Kritik nokta, saldırganın modelin iç işleyişine dair hiçbir gradyan veya ağırlık erişimine ihtiyaç duymamasıdır — tamamen kara-kutu, tekrarlı bir örnekleme prosedürüdür. Bu, BoN'u sıradan bir kurumun bile ucuz bir betikle çalıştırabileceği bir tehdit haline getirir.
BoN'u klasik prompt injection'dan ayıran şey, saldırının artık bir zeka değil bir bütçe problemi olmasıdır. "Hangi cümle guardrail'i kandırır?" sorusu, "Kaç deneme yaparsam guardrail'i kandırmam neredeyse kesinleşir?" sorusuna dönüşür.
Mekanizma: varyant üretimi ve tekrar örnekleme
BoN döngüsü üç adımdan oluşur ve durana kadar tekrar eder:
- Varyant üretimi (augmentation): Aynı isteğin anlamını korurken yüzeyini bozan dönüşümler uygulanır. Metinde bu; harf karıştırma, büyük-küçük harf oynamaları, boşluk/noktalama enjeksiyonu, eşanlamlı ikamesi, kodlama-gizleme (encoding/obfuscation) ve dil karıştırma olabilir. Ses ve görüntü modaliteleri için tını, hız, arka plan gürültüsü ya da piksel bozulması gibi analoglar kullanılır.
- Örnekleme: Her varyant modele bağımsız bir istek olarak gönderilir. Sıcaklık (temperature) sıfır olmadığı sürece aynı varyant bile farklı çıktı üretebilir; bu stokastiklik saldırganın lehinedir.
- Oracle kontrolü: Bir başarı ölçütü (ör. istenen zararlı içeriğin üretilip üretilmediği) her yanıtı denetler. İlk geçen varyant bulununca döngü durur.
Varyantların hiçbiri tek başına "akıllı" değildir; hatta çoğu anlamsızca bozuktur. Gücü toplulukta gizlidir: yeterince çeşitli yüzey, guardrail'in kör noktalarını istatistiksel olarak tarar. Bu yüzden BoN, tek imzaya bağlı kural tabanlı filtreleri özellikle yorar — çünkü aynı niyet her seferinde farklı bir imzayla gelir. Yüzey dönüşümlerinin nasıl çalıştığına dair kodlama ve gizleme saldırıları yazımız temel mekanizmayı ayrıntılandırır.
ASR ve N ilişkisi: neden power-law?
BoN'un en önemli ampirik bulgusu, saldırı başarı oranının (ASR) örnek sayısı N'in bir fonksiyonu olarak power-law benzeri artmasıdır: N büyüdükçe ASR sürekli tırmanır ve pratikte bir doyum tavanına oturmadan yükselmeye devam eder (arXiv 2412.03556). Bu, saldırganın basitçe "daha fazla hesaplama harcayarak" başarı olasılığını satın alabileceği anlamına gelir.
Yayınlanan ölçümlerde bu ilişki somuttur:
| Model | Örnek sayısı (N) | Saldırı başarı oranı (ASR) |
|---|---|---|
| GPT-4o | 10.000 | %89 |
| Claude 3.5 Sonnet | 10.000 | %78 |
| Claude 3.5 Sonnet | 100 | %41 |
Tablo iki şeyi gösterir. Birincisi, en sağlam modeller bile yeterli örnekleme bütçesinde yorulur. İkincisi, ASR daha N=100 gibi görece küçük bir bütçede bile ihmal edilemez seviyededir — yani BoN pahalı bir devlet-seviyesi saldırı değil, mütevazı bir kaynakla ulaşılabilir bir tehdittir. Bu değerler dış literatürden alınmış genel ölçümlerdir; kendi ortamınızdaki eğri, modelinize ve guardrail yığınınıza göre değişir.
Türkçe boyutu: örnekleme bütçesi neden farklı olabilir?
Yayınlanan BoN ölçümleri ağırlıkla İngilizce üzerinedir. Türkçe için kritik bir açık soru şudur: guardrail'ler Türkçe saldırıları taban çizgisinde zaten daha zayıf yakalıyorsa, örnekleme bütçesi eğrisi nasıl değişir?
AltaySec'in kendi ölçümü olan guardrail-arena çalışmasında, test edilen sınıflandırıcıların Türkçe saldırıların yaklaşık %83'ünü kaçırdığı bulunmuştu (AltaySec iç verisi). Bu, Türkçe için taban ASR'nin — yani N=1'deki başarı olasılığının — İngilizce'ye kıyasla belirgin biçimde yüksek başladığını düşündürür. Buradan mantıklı bir hipotez çıkar: eğer tek denemede geçme olasılığı zaten yüksekse, ek varyantların sağladığı marjinal kazanç Türkçe'de daha erken bir platoya oturabilir.
Bunu dikkatle çerçevelemek gerekir: bu bir doğrulanmış sonuç değil, sınanmayı bekleyen bir hipotezdir ve literatürün İngilizce'de gözlemlediği kesintisiz power-law ile gerginlik içindedir. "Türkçe'de başarı doyuma ulaşıyor" demek için elimizde henüz yeterli ölçüm yoktur; söylenebilecek en sağlam ifade, power-law'ın Türkçe'de daha erken plato yapabileceği yönündedir. Doğru cevap ancak ölçümle gelir.
Bu ölçümü üretmek için Türkçe payload kütüphanesi üzerine kurulu Scanner koşularında şu metodolojiyi öneriyoruz — aşağıdaki tablo bir şablondur, hücreler Scanner çıktısıyla doldurulacak ölçüm hedeflerini gösterir, uydurma sayı içermez:
| Türkçe payload | N=1 | N=10 | N=50 | N=100 |
|---|---|---|---|---|
| Payload A (rol yapma) | ölçülecek | ölçülecek | ölçülecek | ölçülecek |
| Payload B (çeviri bahanesi) | ölçülecek | ölçülecek | ölçülecek | ölçülecek |
| Payload C (morfolojik bypass) | ölçülecek | ölçülecek | ölçülecek | ölçülecek |
Her hücre, o payload'un ilgili N bütçesinde en az bir varyantla guardrail'i geçme oranını taşır. Eğriler payload başına çizildiğinde, Türkçe'de platonun gerçekten erken gelip gelmediği görgül olarak görünür hale gelir. Türkçe otomatik jailbreak bütçesi üzerine kamuya açık veri bulunmadığından, bu tablo Türkçe için önemli bir referans boşluğunu doldurmayı amaçlar.
Savunma tarafı: bütçeyi pahalılaştırmak
BoN'a karşı en yaygın yanlış refleks, "daha iyi bir sınıflandırıcı bul" demektir. Oysa BoN tam da tek imza yakalayan sınıflandırıcıları yormak üzere tasarlanmıştır. Doğru savunma duruşu, saldırının ekonomisini bozmaktır: örneklemeyi pahalı, yavaş ve gözle görünür kılmak.
1. Tekrar-varyant hız limiti
BoN imzası tek istekte değil, istek dizisinde saklıdır: kısa sürede, aynı kaynaktan, semantik olarak birbirine çok yakın ama yüzeysel olarak farklı çok sayıda istek. Bu davranışsal deseni yakalamak için örnekleme hızını semantik benzerlik ekseninde sınırlayan bir katman öneriyoruz. Aşağıdaki şablon genel bir savunma prensibini gösterir:
tekrar_varyant_hiz_limiti:
pencere_saniye: 60
ayni_kaynak_max_istek: 20 # ham hız tavanı
semantik_benzerlik_esigi: 0.85 # bu eşiğin üstü "aynı niyet" sayılır
benzer_istek_max: 5 # 60 sn'de aynı-niyetli en fazla 5 deneme
asildiginda:
eylem: yavaslat_ve_isaretle # sert blok yerine gecikme + telemetri
gecikme_ms: 2000 # her ek denemede artan gecikme
olay_kaydi: trueBuradaki fikir, hattı tamamen kesmek değil — meşru kullanıcıyı cezalandırmadan, örnekleme bütçesini saldırgan için katlanarak pahalılaştırmaktır. Artan gecikme ("tarpit"), 10.000 örneklemli bir koşuyu pratikte imkânsız kılar.
2. Semantik kümeleme ile anomali tespiti
Ham hız limiti yeterli değildir; saldırgan kaynağı dağıtabilir. Bu yüzden istekleri gömü (embedding) uzayında kümeleyip, kısa bir zaman penceresinde aynı semantik kümeye düşen ama yüzeyleri sistematik biçimde çeşitlenen istek yoğunluğunu izlemek gerekir. Bu, BoN'un imza-çeşitlemesini tam da güçlü olduğu yerden yakalar.
3. Yanıt tarafında ikinci kapı
Girdi filtresi geçilse bile, üretilen yanıtın zararlılığını denetleyen bir çıktı katmanı BoN'un "tek geçen varyant" mantığını kırar. Girdi + çıktı çift denetimi, çalışma zamanı guardrail mimarisinin temelidir.
Kurumsal savunma ve doğru metrik
BoN, güvenlik ekiplerinin metriklerini değiştirmesini zorunlu kılar. "Bu payload'ı blokluyor muyuz?" sorusu artık anlamsızdır; doğru soru "Bir saldırganın makul bir bütçeyle bizi geçme olasılığı nedir?"dır. Bu yüzden savunma testleri de BoN mantığıyla, yani N'i parametre alarak yürütülmelidir — tek atışlık kırmızı takım koşusu, BoN karşısında gerçek dayanıklılığı fazlasıyla iyimser gösterir. Otomasyonun bu güvenilirlik boyutunu red team otomasyonu ve güvenilirlik mühendisliği yazımızda ele aldık.
Pratik kurumsal duruş üç katmanlıdır: (1) girdi hattında tekrar-varyant hız limiti ve semantik kümeleme; (2) çıktı hattında zararlılık denetimi; (3) sürekli, N-parametreli ölçüm ile eğrinin kurum ortamında nerede plato yaptığını izlemek. AltaySec tarafında bu üç katman, LLM güvenlik duvarı Guardian ile davranışsal hız limiti ve çift-kapı denetimi olarak; ölçüm tarafı ise Scanner ve guardrail-arena ile Türkçe bütçe eğrisi olarak konumlanır.
Sonuç olarak Best-of-N, jailbreak'i bir yaratıcılık yarışından bir kaynak yarışına dönüştürür. Savunmanın işi o kaynağı — zamanı, para ve görünürlüğü — saldırgan için katlanamaz hale getirmektir. Kurumsal ölçüm ve entegrasyon için bizimle iletişime geçebilirsiniz.
