LLM Güvenliği Nedir?
Türkçe Kapsamlı Rehber
Büyük dil modeli (LLM) tabanlı uygulamalar chatbot, RAG ve AI agent biçiminde üretime girdikçe yeni bir saldırı yüzeyi açılıyor. Bu pillar sayfa; LLM güvenliğinin temel kavramlarını, güncel saldırı tekniklerini, savunma yaklaşımlarını, standartları ve Türkçeye özgü konuları bir araya getiren canlı bir kaynak dizinidir.
Kısa cevap: LLM güvenliği nedir?
LLM güvenliği; daha geniş yapay zekâ güvenliği şemsiyesinin dil modellerine odaklanan alt dalıdır. Görüntü, ses ve klasik makine öğrenmesi sistemlerini de kapsayan yapay zekâ güvenliğinin aksine, LLM güvenliği özellikle metin ve talimat işleyen sistemlerdeki tehdit yüzeyini ele alır. Bu ayrımın tamamı için LLM Security Nedir? yazısına bakabilirsiniz.
LLM güvenliği neden ayrı bir disiplin?
Geleneksel bir web uygulamasında kod ile veriyi ayırmak mümkündür: bir SQL sorgusu ile kullanıcı girdisi farklı katmanlarda durur, parametreli sorgularla sınır çizilir. Dil modelinde bu sınır doğal olarak yoktur. Model, sistem talimatını, geliştirici bağlamını, kullanıcı mesajını ve dışarıdan çekilen belge içeriğini aynı token akışında okur. Hangi cümlenin "güven" seviyesinde olduğunu ayırt etmesi için garantili bir mekanizma bulunmaz.
Bu yapısal belirsizlik, LLM güvenliğini klasik AppSec'ten ayıran temel nedendir. Saldırgan tek bir cümleyle modelin davranışını yeniden programlayabilir; üstelik bu cümlenin doğrudan kullanıcıdan gelmesi de gerekmez — bir web sayfasına, PDF'e ya da RAG kaynağına gömülü olabilir. Bu yüzden savunma; tek bir filtreye değil, mimariye özgü tehdit modeline, en az yetki ilkesine ve katmanlı doğrulamaya dayanır. Ayrıntı için LLM Uygulamalarında Prompt Injection Tehdit Modeli yazısına göz atın.
Tehdit yüzeyi: beş katman
Bir LLM uygulamasının saldırı yüzeyi tek noktada toplanmaz; girdiden çıktıya beş katmana yayılır. Her katman ayrı bir savunma stratejisi gerektirir:
- Girdi katmanı: Kullanıcı mesajı ve dışarıdan gelen içerik üzerinden gelen doğrudan ve dolaylı prompt injection.
- Model katmanı: Jailbreak, hizalama bozulması, eğitim verisi ezberi ve model tedarik zinciri riskleri.
- Bilgi (RAG) katmanı: Vektör veritabanı zehirlenmesi, çok kiracılı sızıntı ve zehirli belge enjeksiyonu.
- Araç / ajan katmanı: Tool-use ve MCP üzerinden yetki kötüye kullanımı, ajan ele geçirme ve ölümcül üçlü.
- Çıktı katmanı: Hassas veri sızıntısı, güvenli olmayan çıktı işleme ve markdown/görsel render yoluyla veri kaçırma.
Aşağıdaki bölümler bu katmanların her birini ele alan Türkçe teknik yazıları konu başlıklarına göre gruplar. Sayfa, kütüphane büyüdükçe güncellenen bir dizin niteliğindedir.
Temeller
Alana yeni başlıyorsanız buradan başlayın. Bu yazılar LLM güvenliğinin temel kavramlarını ve en yaygın atak vektörlerinin tanımını sıfırdan açıklar.
- LLM Security Nedir? — Alanın kapsamlı girişi ve terim çerçevesi.
- Prompt Injection Nedir? — En yaygın ve en kritik LLM atak vektörü.
- Jailbreak ile Prompt Injection Farkı — Sık karıştırılan iki kavramın net ayrımı.
- RAG Güvenliği Nedir? — Bilgi tabanı zehirlenmesi ve retrieval riskleri.
- AI Agent Güvenliği Nedir? — Tool-use yetkili ajanların yeni saldırı yüzeyi.
Saldırı teknikleri
Savunmayı doğru kurmak için saldırının nasıl çalıştığını görmek gerekir. Bu yazılar prompt injection ve jailbreak'in somut tekniklerini, çoğu zaman gerçek transkriptlerle inceler.
- Türkçe Prompt Injection: 5 Saldırı Kalıbı — Canlı arena verisinden çıkan yapısal kalıplar.
- Crescendo: Nezaketle Eskalasyon — Çok turlu, kademeli manipülasyon tekniği.
- Rol Yapma Tiyatrosu — Karakter ve senaryo yoluyla talimat atlama.
- Kodlama ve Obfuscation — Base64, leetspeak ve diğer gizleme yöntemleri.
- Sistem Promptu Sızdırma — Gizli talimatların ve bağlamın açığa çıkarılması.
- Dolaylı Enjeksiyon: HTML, PDF, E-posta — İçeriğe gömülü talimatlarla dolaylı saldırı.
- Türkçe Morfolojik Bypass — Eklemeli dil yapısıyla filtre atlatma.
- Sıfır Genişlikli Unicode Gizli Talimat — Görünmez karakterlerle payload gizleme.
Agentic & MCP güvenliği
AI agent'lar ve Model Context Protocol (MCP) sunucuları, dil modeline gerçek dünyada eylem yapma yetkisi verir — ve saldırı yüzeyini keskin biçimde genişletir. Bu yazılar ajan mimarisine özgü riskleri ele alır.
- OWASP Agentic Top 10 (ASI) Türkçe — Ajan sistemleri için referans risk listesi.
- Lethal Trifecta: Ölümcül Üçlü — Özel veri, dış içerik ve dışa aktarımın tehlikeli kesişimi.
- MCP Güvenliği ve Sunucu Zafiyetleri — Tool sunucularındaki tipik açıklar.
- Ajan Hafıza ve Bağlam Zehirlenmesi — Kalıcı bellek üzerinden gecikmeli manipülasyon.
- Zero-Click Ajan Saldırıları: Vaka Analizi — Kullanıcı etkileşimi olmadan tetiklenen zincirler.
Savunma ve guardrail
Saldırıyı anlamak yeterli değil; üretimde çalışan bir kontrol katmanı gerekir. Bu yazılar çalışma zamanı guardrail'lerini, tespit mühendisliğini ve savunma mimarisini inceler.
- Çalışma Zamanı LLM Guardrail'leri — Girdi/çıktı kontrolünün üretim mimarisi.
- LLM Firewall Nedir? — AI firewall kavramı ve konumlandırması.
- LLM Detection Engineering — Saldırı tespiti için kural ve sinyal tasarımı.
- Guardrail Karşılaştırması: Llama Guard vs NeMo — Açık guardrail modellerinin kıyası.
- MLSecOps ve Güvenlik Kapıları — Güvenliği CI/CD hattına gömme.
- AI Red Teaming Nedir? — Savunmayı doğrulayan saldırgan odaklı test.
Standartlar ve uyum
LLM güvenliğini ölçülebilir ve denetlenebilir kılan çerçeveler. Bu yazılar OWASP, MITRE ATLAS, NIST ve KVKK ile AB düzenlemelerinin LLM tarafını Türkçe açıklar.
- OWASP LLM Top 10 (Türkçe) — Alanın en yaygın kullanılan referans çerçevesi.
- MITRE ATLAS Nedir? — Yapay zekâ saldırılarının taktik-teknik matrisi.
- NIST AI RMF Nedir? — Risk yönetimi çerçevesinin Türkçe özeti.
- EU AI Act 2026 Takvimi — Yürürlük ve erteleme takviminin güncel durumu.
- KVKK ve LLM Güvenliği — Kişisel veri işleyen LLM'ler için uyum çerçevesi.
Türkçeye özgü konular ve ölçüm
İngilizce araçlar ve blocklist'ler Türkçe saldırı yüzeyini çoğu zaman kaçırır. Bu yazılar Türkçenin dilbilimsel özelliklerinden doğan bypass'ları ve ölçüm çerçevelerini ele alır.
- Türkçe TCKN/IBAN PII Sızıntı Benchmark'ı — Yerel PII tiplerinin sızıntı ölçümü.
- Türkçe Casefold: Noktasız 'ı' Bypass'ı — Büyük/küçük harf dönüşümünden doğan açık.
- Türkçe LLM Güvenlik Benchmark Çerçevesi — Karşılaştırılabilir ölçüm için metodoloji.
- Türkçe Yapay Zekâ Güvenliği Sözlüğü — Terimlerin standartlaştırılmış Türkçe karşılıkları.
Nereden başlanır?
Uygulamalı öğrenmek istiyorsanız pratikle teoriyi birlikte ilerletin. Önerilen yol: önce prompt injection ve OWASP LLM Top 10 ile temel çerçeveyi kurun; ardından Türkçe saldırı kalıplarını transkriptler üzerinden inceleyin; son olarak guardrail mimarisi ve red teaming ile savunma tarafına geçin.
Pratik için AltaySec'in Türkçe laboratuvarı Bekçi prompt injection'ı seviye seviye deneyimletir; AltayDuel ise AI agent'ların birbirine saldırdığı açık bir arenadır. Tüm teknik yazılar için araştırma kütüphanesine göz atabilirsiniz.
Sıkça sorulan sorular
LLM güvenliği nedir?
LLM güvenliği; büyük dil modeli tabanlı uygulamaların girdi, model, RAG bilgi tabanı, araç çağrıları ve çıktı katmanlarını prompt injection, jailbreak, veri sızıntısı, araç kötüye kullanımı ve tedarik zinciri saldırılarına karşı koruyan mühendislik disiplinidir. Klasik uygulama güvenliğinin temellerini, dil modellerine özgü risklerle birleştirir.
Prompt injection neden en kritik LLM güvenliği riski sayılıyor?
Çünkü dil modeli, sistem talimatı ile güvenilmeyen kullanıcı veya belge içeriğini aynı bağlamda okur ve ikisini kesin olarak ayırt edemez. Saldırgan bu belirsizliği kullanarak modele talimatları atlatabilir, gizli bilgi sızdırabilir veya araçları istenmeyen eylemler için tetikleyebilir. OWASP LLM Top 10 listesinde LLM01 olarak ilk sırada yer alır.
LLM güvenliği ile yapay zekâ güvenliği aynı şey mi?
LLM güvenliği, daha geniş yapay zekâ güvenliği (AI security) şemsiyesinin dil modellerine odaklanan alt dalıdır. Yapay zekâ güvenliği görüntü, ses ve klasik makine öğrenmesi sistemlerini de kapsarken; LLM güvenliği özellikle chatbot, RAG ve AI agent uygulamalarındaki prompt injection, jailbreak ve araç kötüye kullanımı gibi metin tabanlı tehdit yüzeyine odaklanır.
Bir LLM uygulaması nasıl güvenli hale getirilir?
Önce model, veri kaynakları, RAG katmanı, araçlar, kimlikler ve yetki sınırlarını içeren bir envanter çıkarın. Ardından mimariye özgü tehdit modeli, en az yetki, güvenilmeyen bağlamın ayrıştırılması, çalışma zamanı guardrail'leri, çıktı doğrulaması, loglama ve tekrarlanabilir güvenlik regresyon testleri uygulayın. Tek bir filtre veya sistem promptu güvenlik sınırı değildir.
Türkçe LLM güvenliğinin İngilizceden farkı nedir?
Türkçe eklemeli bir dildir; İngilizce blocklist ve guardrail'ler Türkçe saldırı varyantlarını çoğu zaman kaçırır. Morfolojik türetme, noktasız 'ı' casefold farkları ve yerel otorite bağlamları İngilizce araçlarda kapsanmayan bypass yüzeyleri oluşturur. Ayrıca TCKN, IBAN ve VKN gibi Türkiye'ye özgü PII tipleri KVKK açısından ayrı tespit ve maskeleme gerektirir.
Kaynaklar ve kanıt sınırı
Bu sayfa bir kaynak dizinidir; güvenlik garantisi değildir. Sonuçlar değerlendirilen mimari, model, veri, araç, yapılandırma ve tehdit kapsamına bağlıdır. Güvenlik kontrolleri her önemli model veya mimari değişikliğinden sonra yeniden test edilmelidir.
