Blue Team Tespiti · Ajan Hafızası

LLM Ajanlarında Hafıza Zehirlenmesi Tespiti
MINJA, sleeper saldırıları ve davranış-sapması sinyalleri

Prompt injection tek bir oturumda yaşar; hafıza zehirlenmesi ajanın kalıcı belleğine yerleşir ve günler sonra tetiklenir. Bu yazı, kalıcı ajan hafızasına sızan talimatın Blue Team tarafında nasıl tespit edileceğini akademik bulgular üzerinden ele alıyor.

Hafıza Zehirlenmesi Nedir?

Hafıza zehirlenmesi (memory poisoning), bir LLM ajanının oturumlar arası taşıdığı kalıcı hafızaya (uzun süreli bellek, konuşma özeti veya ajan not defteri) kötü niyetli bir talimatın yerleştirilmesi ve bu talimatın sonraki konuşmalarda ajanın davranışını yönlendirmesidir. Klasik prompt injection tek bir istek-yanıt döngüsünde yaşar ve oturum bitince kaybolur; hafıza zehirlenmesinde ise enjekte edilen içerik hafızaya yazılır, orada kalır ve saldırgan artık ortamda olmasa bile aylar sonra etkisini gösterebilir.

Bu ayrım tespit açısından belirleyicidir: tehdit tek bir kötü niyetli girdide değil, hafızaya sızmış talimat ile onu tetikleyen masum görünümlü sorgu arasındaki zamansal ve bağlamsal kopuklukta gizlidir. Bu yüzden savunma, istek anındaki içerik filtresinin ötesinde hafıza-yazma ve hafıza-okuma katmanlarını da izlemek zorundadır.

OWASP'ın ajan güvenliği çalışmaları hafıza zehirlenmesini bağımsız bir ajan tehdidi (Memory Poisoning) olarak sınıflandırır; MITRE ATLAS ise saldırganın modelin kalıcı durumunu manipüle ettiği teknikleri düşman taktikleri çatısında ele alır.

MINJA ve Sleeper: İki Saldırı Kalıbı

Akademik literatürdeki iki kalıp, hafıza zehirlenmesinin neden tespiti zor bir tehdit olduğunu net biçimde gösteriyor.

MINJA — yalnızca sorgu ile hafıza enjeksiyonu

MINJA (Memory Injection Attack), saldırganın ajanın iç bileşenlerine hiçbir ayrıcalıklı erişimi olmadan, yalnızca normal kullanıcı sorguları üzerinden hafızaya kötü niyetli kayıt sızdırdığı bir tekniktir. Enjeksiyon, ajanın kendi hafıza-yazma mekanizmasını istismar ederek gerçekleşir; saldırgan sistem-düzeyinde bir açıktan değil, meşru bir kullanıcı gibi davranarak içeri girer. İlgili akademik çalışmada bu query-only yaklaşımın %95'in üzerinde enjeksiyon başarı oranı gösterdiği raporlanmıştır. Ayrıcalık gerektirmemesi, MINJA'yı erişim kontrolüne dayanan savunmalar için özellikle sinsi kılar.

Sleeper — uykuda kalan, gecikmeli tetiklenen hafıza

Sleeper (uyuyan) hafıza zehirlenmesinde uydurulmuş bir hafıza kaydı saklanır, uzun süre uykuda kalır ve ancak belirli bir tetik cümlesi veya bağlam sonraki konuşmalarda ortaya çıktığında yeniden etkinleşir. Akademik bulgular, gömülen içeriğin oturumlar boyunca sessiz kalıp koşul sağlandığında yeniden tetiklendiğini gösteriyor. Bu gecikme, enjeksiyon anı ile zararlı davranışın ortaya çıktığı anı zamansal olarak birbirinden ayırır; olay müdahalesi ekipleri kök nedeni bulmak için genellikle günler öncesine ait hafıza-yazma olaylarına kadar geri gitmek zorunda kalır.

Neden RAG Belge Zehirlenmesinden Farklı?

Hafıza zehirlenmesi çoğu zaman RAG (bilgi getirimli üretim) zehirlenmesiyle karıştırılır, ancak iki tehdit farklı katmanlarda yaşar ve farklı tespit stratejileri gerektirir.

BoyutRAG / vektör-DB zehirlenmesiKalıcı ajan hafızası zehirlenmesi
Hedef katmanHarici belge deposu / vektör indeksiAjanın kendi uzun süreli hafızası
Yazan tarafİçerik sağlayıcı / veri hattıAjanın hafıza-yazma mekanizması
KalıcılıkBelge silinene kadarHafıza kaydı temizlenene kadar, kullanıcıya özel
Tespit odağıBelge provenance ve getirim sağlamasıOturumlar arası davranış-sapması

RAG tarafındaki izleme ve vektör-DB savunmalarını ayrı bir yazıda ele aldık: bkz. RAG güvenlik izleme ve vektör-DB. Genel ajan tehdit yüzeyi için ise AI ajan güvenliği nedir yazısı hafıza zehirlenmesini bir başlık olarak sayar; bu yazı ise o başlığın tespit katmanını derinleştiriyor.

Davranış-Sapması Sinyalleri: Blue Team Tespiti

Hafıza zehirlenmesi tek bir istekte nadiren görünür olduğu için, tespit içerik filtresinden çok zaman içindeki davranış tutarlılığına dayanır. Blue Team için izlenmesi gereken sinyaller kabaca dört başlıkta toplanır.

  • Yanıt tutarsızlığı: Aynı veya benzer sorgunun temiz bir oturumda ve şüpheli hafıza yüklü bir oturumda belirgin biçimde farklı yanıtlar üretmesi. Kontrollü bir 'temiz oturum' referansıyla karşılaştırma, gömülü talimatın parmak izini ortaya çıkarır.
  • Gecikmeli tetiklenme: Zararlı davranışın enjeksiyon anıyla değil, sonradan gelen belirli bir tetik bağlamıyla eşleşmesi. Olay müdahalesinde tetik anından geriye doğru hafıza-yazma günlüklerini izlemek kök nedeni açığa çıkarır.
  • Hafıza-yazma anomalileri: Ajanın hafızasına, o oturumun görev bağlamıyla orantısız uzunlukta, talimat kipinde ("her zaman...", "bundan sonra...") veya kullanıcının açıkça istemediği kalıcı yönlendirmeler yazması.
  • Kaynak-atıf kopukluğu: Ajanın bir davranışı gerekçelendirirken atıfta bulunduğu 'hatırladığı' bilginin, doğrulanabilir bir kullanıcı geçmişine veya belgeye dayanmaması.

Pratik bir tespit disiplini, her hafıza-okuma olayında ajanın çıkarımını iki referansla karşılaştırmaktır: (1) hafızasız çalışan bir gölge model ve (2) aynı kullanıcının doğrulanmış geçmişi. İkisinden birinde belirgin sapma, hafıza kaydını karantinaya almak için yeterli sinyaldir. Bu telemetriyi mahremiyeti koruyarak toplamanın yöntemleri için gizlilik korumalı AI güvenlik telemetrisi yazısına bakılabilir.

İki-Aşamalı Gating Savunması

Tespitin yanına yerleştirilecek doğrudan bir azaltıcı savunma, hafıza yolunun iki noktasında kapı (gate) kurmaktır. MINJA'yı inceleyen akademik çalışmanın savunma bölümü, statik sezgisel kurallar (heuristik) ve anahtar kelime eşleştirmeyi birleştiren iki-aşamalı bir gating yaklaşımının hafıza-manipülasyon ifadelerini düşürerek enjeksiyonun etkisini azalttığını gösteriyor.

Kurumsal bir uyarlamada bu iki aşama şöyle konumlanır:

1. Yazma kapısı (write-gate)
   - Hafızaya kaydedilmek istenen içerik statik heuristikten geçer.
   - Talimat kipi, kalıcılık ifadeleri ve tetik-benzeri kalıplar işaretlenir.

2. Okuma kapısı (read-gate)
   - Hafızadan çekilen kayıt, çıkarıma girmeden önce
     anahtar kelime ve kalıp eşleştirmeden geçer.
   - İşaretli kayıt karantinaya alınır veya nötrleştirilir.

Bu iki kapı, çalışma zamanı guardrail mimarisinin doğal bir uzantısıdır; genel prensipler için çalışma zamanı LLM guardrail'leri yazısına bakılabilir. AltaySec tarafında bu kapıları LLM güvenlik duvarımız Guardian'ın hafıza-farkında politika katmanında değerlendiriyoruz; yazma ve okuma anlarında ajan hafızasını denetleyen politikalar, gecikmeli tetik penceresini önemli ölçüde daraltır. Statik heuristik ve anahtar kelime eşleştirmenin sınırlı olduğunu, gelişmiş saldırıların bunları atlatabileceğini de not etmek gerekir; gating tek başına değil, davranış-sapması izlemesiyle katmanlı kullanılmalıdır.

Guardrail Körlüğü Ayrı Bir Problemdir

Hafıza zehirlenmesi tespitini planlarken sık yapılan bir hata, mevcut guardrail metriklerini hafıza-tespit eşiği sanmaktır. AltaySec'in kendi ölçüm ortamı olan guardrail-arena çalışmasında gözlemlediğimiz aşırı-reddetme ve jailbreak kaçırma oranları, guardrail katmanının kendi körlüğünü ölçer; bunlar hafıza zehirlenmesi tespit eşiği değildir ve öyle sunulmamalıdır. İki problem farklı deney tasarımlarına aittir: biri anlık istek filtresinin kalibrasyonunu, diğeri kalıcı hafızadaki davranış sapmasını ele alır.

Doğru okuma şudur: guardrail körlüğü, hafıza zehirlenmesi tetiklendiğinde ortaya çıkan zararlı çıktının filtreden geçme olasılığını artıran ayrı ve tamamlayıcı bir risktir. Yani zayıf bir guardrail, zehirli hafızanın etkisini büyütür ama onu tespit etmez. Türkçe girdilerde guardrail körlüğünün kendine özgü kalıpları için Türkçe prompt injection saldırı kalıpları yazısındaki bulgularımız yol gösterici olabilir. Ayrıca hafıza deposuna dış veri seti üzerinden bulaşma riskini veri seti şema ve provenance disipliniyle sınırlandırmak, tedarik zinciri tarafını kapatır.

Kurumsal Tespit Kontrol Listesi

Hafıza-farkında bir ajan mimarisinde Blue Team'in asgari denetim listesi şöyle özetlenebilir:

  1. Hafıza-yazma günlüğü: Her hafıza kaydını kaynak oturum, zaman damgası ve tetikleyen sorgu ile ilişkilendirin; gecikmeli tetik soruşturmasının temelidir.
  2. Temiz-oturum referansı: Kritik sorgular için hafızasız gölge model karşılaştırması çalıştırın ve sapmayı ölçün.
  3. Yazma/okuma kapıları: İki-aşamalı gating'i hafızanın her iki ucuna yerleştirin; işaretli kayıtları karantinaya alın.
  4. Kullanıcı-kapsamlı hafıza izolasyonu: Bir kullanıcının zehirlenmiş hafızasının başka kullanıcılara sızmamasını sağlayın.
  5. Olay müdahalesi kancası: Zararlı davranış tespitinde ilgili hafıza kayıtlarını geriye dönük tarayacak müdahale adımı tanımlayın; genel akış için AI olay müdahalesi playbook'u.

Bu yaklaşım, Türkçe kaynaklarda az işlenen bir konuyu — kalıcı ajan hafızası zehirlenmesinin tespitini — savunulabilir bir tespit disiplinine dönüştürmeyi amaçlıyor. Akademik literatür İngilizcede yoğundur; bu yazının katkısı, bu bulguları Türkçe bir Blue Team çerçevesine oturtmaktır. Ajan hafızasını denetleyen bir mimari kurmak için AltaySec ekibiyle iletişime geçebilirsiniz.

Kaynaklar

İlgili Yazılar