Re-Ranker Saldırıları: Cross-Encoder Manipülasyonuyla RAG Sıralaması Nasıl Ele Geçirilir?
Zehirli pasajı 1. sıraya taşımanın anatomisi ve Türkçe dayanıklılık çerçevesi
RAG hatlarında güvenilirliği artırmak için eklenen re-ranker katmanı, saldırı yüzeyini de değiştirir. Cross-encoder'ın "en alakalı" kararını kimin verdiği, çoğu zaman modelin kendisinin değil; pasaja gömülen dilin sorusudur.
Re-Ranker (Yeniden Sıralayıcı) Saldırısı Nedir?
Re-ranker saldırısı, bir RAG (retrieval-augmented generation) hattında getirilen belgelerin nihai sıralamasını belirleyen cross-encoder modelini, saldırganın kontrol ettiği bir pasajı yapay olarak en üst sıraya taşıyacak biçimde manipüle etme tekniğidir. Amaç, dil modeline hangi bağlamın "en alakalı" olarak sunulacağını ele geçirmektir; böylece zehirli talimat, yanlış bilgi veya sızdırma tetikleyicisi barındıran pasaj, meşru belgelerin önüne geçirilerek üretime giren cevabın kaynağı haline getirilir.
Tipik bir RAG hattı iki aşamalıdır. Önce vektör benzerliğine dayalı hızlı bir getirici (bi-encoder / gömü tabanlı arama) aday belgeleri toplar; ardından re-ranker bu adayları daha maliyetli ama daha isabetli bir skorlamayla yeniden sıralar. Re-ranker'ın işlevi, ilk aşamanın "kaba" alaka sıralamasını rafine etmektir. Saldırı, tam da bu rafinasyon adımını hedef alır: getiriciyi geçebilen bir pasaj, re-ranker'ı da kandırabilirse, nihai bağlam penceresinin en üst satırlarına yerleşir.
Bu, klasik dolaylı prompt injection'ın bir üst katmanıdır. Enjekte edilen içeriğin yalnızca korpusa girmesi değil, aynı zamanda sıralamada kazanması gerekir. Re-ranker saldırıları, işte bu "sıralamada kazanma" mekaniğini istismar eder.
Cross-Encoder Neden Manipüle Edilebilir?
Bi-encoder mimarilerin aksine cross-encoder, sorgu ile belgeyi birlikte tek bir ileri geçişte işleyerek bir alaka skoru üretir. Sorgu ve doküman aynı bağlamda kodlandığı için model, ikisi arasındaki ince anlamsal ilişkileri yakalayabilir; isabetinin yüksek olmasının nedeni budur. Ancak bu birlikte-kodlama, saldırgana da bir kaldıraç verir: pasaj metni, skoru optimize etmek üzere doğrudan biçimlendirilebilir.
Manipülasyonun kaynağı, re-ranker'ın "alaka"yı öğrenilmiş bir yakınlık sinyali olarak modellemesidir; niyet, doğruluk veya güvenlik değil. Sorgunun anahtar terimlerini yoğunlaştıran, sorguyu neredeyse birebir tekrarlayan ya da sorgunun kastettiği bağlamı taklit eden bir pasaj, semantik olarak "çok alakalı" görünür. Model, bu görünürdeki alakayı yüksek skorla ödüllendirir. Saldırgan için bu, bir sınıflandırıcıyı düşman örneklerle zorlamaya benzer: çıktı skorunu maksimize eden girdiyi aramak.
Ekosistemde yaygın kullanılan üç örnek, saldırı yüzeyinin ölçeğini gösterir. Aşağıdaki tablo yalnızca doğrulanmış teknik nitelikleri listeler.
| Model | Tür | Erişim | Çok dilli |
|---|---|---|---|
| bge-reranker-v2-m3 | Açık ağırlık (Apache 2.0, <600M parametre) | Kendi altyapında barındırma | Evet |
| Cohere Rerank | Ticari API | Bulut | Evet |
| Jina Reranker v2 | Ticari / API | Bulut | Evet |
Üçü de cross-encoder ilkesiyle çalışır: sorgu+doküman çiftini birlikte skorlayıp top-k'yi yeniden sıralar. Dolayısıyla manipülasyon prensibi mimariden bağımsızdır; açık ağırlıklı bir modelde saldırgan skor gradyanına yaklaşabilirken, kapalı API'lerde kara-kutu deneme-yanılma daha belirleyici olur.
Sıralamayı Ele Geçiren Saldırı Sınıfları
Re-ranker'a yönelik manipülasyon, birbirini besleyen birkaç sınıfa ayrılır. Aşağıdakiler kavramsal kategorilerdir; her biri korpusa yazma yetkisi kazanmış bir saldırganın elindeki tekniklerdir.
- Sorgu-yankısı (adversarial passage ranking): Pasaj, hedef sorgunun anahtar terimlerini ve olası ifade biçimlerini yoğun biçimde barındıracak şekilde yazılır. Cross-encoder, yüzeysel örtüşmeyi güçlü bir alaka sinyali olarak okur.
- Anahtar kelime doldurma: Görünmez veya bağlamsız terim yığınları, pasajın çok sayıda muhtemel sorguyla eşleşme olasılığını yükseltir. Klasik SEO spam'inin retrieval karşılığıdır.
- Bağlam taklidi: Pasaj, meşru bir kurumsal doküman, politika metni ya da resmi kayıt üslubunu taklit ederek hem getiriciyi hem re-ranker'ı "otoriter kaynak" izlenimiyle kandırmaya çalışır.
- Yetki + aciliyet dili: Pasaja gömülen "yetkili talimattır", "derhal uygulanmalıdır", "güvenlik gereği önceliklidir" gibi ifadeler, hem sıralama hem de sonradan üretim aşamasındaki talimat-uyumu için ikili kaldıraç sağlar.
Bu sınıflar tek başına da işler; ancak asıl risk kombinasyonda ortaya çıkar. Sorgu-yankısı pasajı re-ranker'da yükseltir, yetki-aciliyet dili ise pasaj üste çıktıktan sonra dil modelinin o pasajı talimat olarak benimseme ihtimalini artırır. Enjeksiyon tekniklerinin Türkçe'deki tezahürlerini ayrıntılı incelediğimiz Türkçe prompt injection saldırı kalıpları yazısı, bu dilsel kaldıraçları besleyen kalıpları listeler.
Ters-Sezgisel Risk: Re-Ranker Eklemek Her Zaman Güvenli mi?
Yaygın varsayım, re-ranker'ın hattı yalnızca iyileştirdiği yönündedir: daha isabetli sıralama, daha az gürültü, daha güvenilir bağlam. Bu, alaka açısından genellikle doğrudur. Ancak güvenlik açısından ele alınması gereken, ters-sezgisel bir olasılık vardır.
Olası bir risk olarak değerlendirdiğimiz hipotez şudur: re-ranker'ın alakayı ödüllendiren skorlaması, bazı saldırı sınıflarında sıralamayı daha kolay ele geçirilebilir kılabilir. Özellikle yetki ve aciliyet dilini yoğun biçimde taşıyan bir pasaj, sorguyla güçlü yüzeysel örtüşme kurduğunda, re-ranker onu bilinçli olarak üste taşıyabilir. Bu senaryoda ek katman, saldırganın pasajına ek bir "kazanma yolu" açar: yalnız getiriciyi değil, getiriciyi geçemese bile re-ranker'ı ikna etmek yeterli olabilir.
Bu ifadenin sınırını net çizmek gerekir: bunu kontrollü ölçümle kesinleştirilmiş ampirik bir bulgu olarak sunmuyoruz. Şu an için gerekçelendirilmiş bir tehdit hipotezidir ve karşılaştırmalı, kör bir ölçüm çerçevesiyle sınanmayı bekler. Güvenlik mühendisliğinde doğru duruş, "re-ranker eklemek her koşulda saldırı yüzeyini küçültür" varsayımını sorgulamak; katmanın hem alakaya hem de saldırıya nasıl tepki verdiğini ayrı ayrı ölçmektir.
Türkçe Dayanıklılık Ölçümü İçin Bir Çerçeve
Re-ranker dayanıklılığı, çoğunlukla İngilizce korpuslar üzerinde tartışılır. Türkçe, sondan eklemeli morfolojisi ve ödünç terminolojisiyle sıralama skorlarını farklı biçimde etkileyebilir; bu, Türkçe'de az işlenen bir ölçüm alanıdır. Savunulabilir bir çerçeve şu bileşenlerden kurulur:
- Sabit sorgu kümesi: Aynı Türkçe sorgu seti, üç re-ranker (bge-reranker-v2-m3, Cohere Rerank, Jina Reranker v2) üzerinde aynı korpusla çalıştırılır.
- Zehirli pasaj enjeksiyonu: Her sorgu için, saldırı sınıflarına (sorgu-yankısı, bağlam taklidi, yetki-aciliyet) göre biçimlendirilmiş bir pasaj korpusa eklenir.
- Başarı metriği: "Zehirli pasajı 1. sıraya taşıma" oranı, model ve saldırı sınıfı kırılımında ölçülür.
- Kör karşılaştırma: Re-ranker'lı ve re-ranker'sız hatlar, aynı saldırı altında yan yana koşularak katmanın net etkisi izole edilir.
Burada bir dürüstlük notu şart: bu çerçeveye ilişkin spesifik başarı yüzdeleri, kontrollü bir koşumda ölçülmeden paylaşılmamalıdır. Yukarıdaki tasarım, bir ölçüm metodolojisidir; henüz raporlanabilir bir sayısal sonuç değildir. Bu ayrımı korumak, sonuçların güvenilirliğinin ön koşuludur.
Çerçevenin dilsel omurgası, AltaySec'in kendi ölçümünden gelir. AltayDuel verisinde yayımladığımız 297 düellodan çıkan Yetki+Aciliyet kalıbı, saldırgan pasajlarının hem enjeksiyon hem de sıralama aşamasında kullandığı dilin neye benzediğini gösterir; ayrıntısını Yetki+Aciliyet prompt injection kalıbı ve sağlayıcı matrisi saldırı direnci yazılarında ele aldık. Re-ranker ölçümü için önerdiğimiz zehirli pasajlar, bu yayımlanmış kalıptan türetilir; böylece dilsel gerçekçilik, uydurma örneklerle değil, gözlemlenmiş saldırgan diliyle sağlanır.
Savunma: Sıralama Skorunu Tek Karar Mercii Yapmayın
Re-ranker manipülasyonuna karşı savunma, tek bir kontrole değil katmanlı bir yaklaşıma dayanır. Temel prensipler şunlardır:
- Kaynak provenansı ve yazma denetimi: Korpusa neyin, kimin tarafından yazıldığını izleyin. Saldırının önkoşulu, kötücül pasajın korpusa girmesidir; getirmeden önceki hijyen en ucuz savunmadır. RAG güvenlik izleme ve vektör veritabanı yazısındaki telemetri prensipleri buraya uygulanır.
- Skoru bağlamla çaprazlayın: Yüksek re-ranker skorunu tek gerçek kaynağı saymayın. Kaynak güveni, belge yaşı, imza/provenans ve tekilleştirme sinyallerini sıralamaya dahil edin.
- Anomali tespiti: Ani "tüm sorgularda üste çıkan" pasajlar, anahtar kelime yoğunluğu aşırı yüksek metinler ve yetki-aciliyet dili taşıyan içerikler işaretlenmeli.
- Üretim katmanında talimat yalıtımı: Getirilen bağlamın talimat olarak yorumlanmasını engelleyen sistem promptu tasarımı, pasaj üste çıksa bile etkiyi sınırlar.
- Çalışma zamanı denetimi: Bağlam penceresine giren içeriği ve üretilen çıktıyı bir güvenlik duvarından geçirmek, sıralama katmanının atlandığı durumları yakalar. AltaySec'in Guardian LLM güvenlik duvarı, tam da bu çalışma zamanı denetimini hedefler.
Özetle: re-ranker, alaka için değerli bir katmandır; ancak güvenlik açısından "en üstteki pasaj en güvenilir pasajdır" varsayımı test edilmeden kabul edilmemelidir. Sıralama bir öneridir, karar değil. RAG güvenliğinin bütününe dair temel için RAG güvenliği nedir yazımıza bakılabilir.
