Pillar Rehber · LLM Güvenliği · Türkçe Kaynak Kütüphanesi

LLM Güvenliği Nedir?
Türkçe Kapsamlı Rehber

Büyük dil modeli (LLM) tabanlı uygulamalar chatbot, RAG ve AI agent biçiminde üretime girdikçe yeni bir saldırı yüzeyi açılıyor. Bu pillar sayfa; LLM güvenliğinin temel kavramlarını, güncel saldırı tekniklerini, savunma yaklaşımlarını, standartları ve Türkçeye özgü konuları bir araya getiren canlı bir kaynak dizinidir.

Kısa cevap: LLM güvenliği nedir?

LLM güvenliği (LLM security), büyük dil modeli tabanlı uygulamaların girdi, model, RAG bilgi tabanı, araç çağrıları ve çıktı katmanlarını prompt injection, jailbreak, veri sızıntısı, araç kötüye kullanımı ve tedarik zinciri saldırılarına karşı koruyan mühendislik disiplinidir. Klasik uygulama güvenliğinin kimlik, yetkilendirme, güvenli yazılım geliştirme ve izleme temellerini, dil modellerine özgü risklerle birleştirir.

LLM güvenliği; daha geniş yapay zekâ güvenliği şemsiyesinin dil modellerine odaklanan alt dalıdır. Görüntü, ses ve klasik makine öğrenmesi sistemlerini de kapsayan yapay zekâ güvenliğinin aksine, LLM güvenliği özellikle metin ve talimat işleyen sistemlerdeki tehdit yüzeyini ele alır. Bu ayrımın tamamı için LLM Security Nedir? yazısına bakabilirsiniz.

LLM güvenliği neden ayrı bir disiplin?

Geleneksel bir web uygulamasında kod ile veriyi ayırmak mümkündür: bir SQL sorgusu ile kullanıcı girdisi farklı katmanlarda durur, parametreli sorgularla sınır çizilir. Dil modelinde bu sınır doğal olarak yoktur. Model, sistem talimatını, geliştirici bağlamını, kullanıcı mesajını ve dışarıdan çekilen belge içeriğini aynı token akışında okur. Hangi cümlenin "güven" seviyesinde olduğunu ayırt etmesi için garantili bir mekanizma bulunmaz.

Bu yapısal belirsizlik, LLM güvenliğini klasik AppSec'ten ayıran temel nedendir. Saldırgan tek bir cümleyle modelin davranışını yeniden programlayabilir; üstelik bu cümlenin doğrudan kullanıcıdan gelmesi de gerekmez — bir web sayfasına, PDF'e ya da RAG kaynağına gömülü olabilir. Bu yüzden savunma; tek bir filtreye değil, mimariye özgü tehdit modeline, en az yetki ilkesine ve katmanlı doğrulamaya dayanır. Ayrıntı için LLM Uygulamalarında Prompt Injection Tehdit Modeli yazısına göz atın.

Tehdit yüzeyi: beş katman

Bir LLM uygulamasının saldırı yüzeyi tek noktada toplanmaz; girdiden çıktıya beş katmana yayılır. Her katman ayrı bir savunma stratejisi gerektirir:

  • Girdi katmanı: Kullanıcı mesajı ve dışarıdan gelen içerik üzerinden gelen doğrudan ve dolaylı prompt injection.
  • Model katmanı: Jailbreak, hizalama bozulması, eğitim verisi ezberi ve model tedarik zinciri riskleri.
  • Bilgi (RAG) katmanı: Vektör veritabanı zehirlenmesi, çok kiracılı sızıntı ve zehirli belge enjeksiyonu.
  • Araç / ajan katmanı: Tool-use ve MCP üzerinden yetki kötüye kullanımı, ajan ele geçirme ve ölümcül üçlü.
  • Çıktı katmanı: Hassas veri sızıntısı, güvenli olmayan çıktı işleme ve markdown/görsel render yoluyla veri kaçırma.

Aşağıdaki bölümler bu katmanların her birini ele alan Türkçe teknik yazıları konu başlıklarına göre gruplar. Sayfa, kütüphane büyüdükçe güncellenen bir dizin niteliğindedir.

Temeller

Alana yeni başlıyorsanız buradan başlayın. Bu yazılar LLM güvenliğinin temel kavramlarını ve en yaygın atak vektörlerinin tanımını sıfırdan açıklar.

Saldırı teknikleri

Savunmayı doğru kurmak için saldırının nasıl çalıştığını görmek gerekir. Bu yazılar prompt injection ve jailbreak'in somut tekniklerini, çoğu zaman gerçek transkriptlerle inceler.

Agentic & MCP güvenliği

AI agent'lar ve Model Context Protocol (MCP) sunucuları, dil modeline gerçek dünyada eylem yapma yetkisi verir — ve saldırı yüzeyini keskin biçimde genişletir. Bu yazılar ajan mimarisine özgü riskleri ele alır.

Savunma ve guardrail

Saldırıyı anlamak yeterli değil; üretimde çalışan bir kontrol katmanı gerekir. Bu yazılar çalışma zamanı guardrail'lerini, tespit mühendisliğini ve savunma mimarisini inceler.

Standartlar ve uyum

LLM güvenliğini ölçülebilir ve denetlenebilir kılan çerçeveler. Bu yazılar OWASP, MITRE ATLAS, NIST ve KVKK ile AB düzenlemelerinin LLM tarafını Türkçe açıklar.

Türkçeye özgü konular ve ölçüm

İngilizce araçlar ve blocklist'ler Türkçe saldırı yüzeyini çoğu zaman kaçırır. Bu yazılar Türkçenin dilbilimsel özelliklerinden doğan bypass'ları ve ölçüm çerçevelerini ele alır.

Nereden başlanır?

Uygulamalı öğrenmek istiyorsanız pratikle teoriyi birlikte ilerletin. Önerilen yol: önce prompt injection ve OWASP LLM Top 10 ile temel çerçeveyi kurun; ardından Türkçe saldırı kalıplarını transkriptler üzerinden inceleyin; son olarak guardrail mimarisi ve red teaming ile savunma tarafına geçin.

Pratik için AltaySec'in Türkçe laboratuvarı Bekçi prompt injection'ı seviye seviye deneyimletir; AltayDuel ise AI agent'ların birbirine saldırdığı açık bir arenadır. Tüm teknik yazılar için araştırma kütüphanesine göz atabilirsiniz.

Sıkça sorulan sorular

LLM güvenliği nedir?

LLM güvenliği; büyük dil modeli tabanlı uygulamaların girdi, model, RAG bilgi tabanı, araç çağrıları ve çıktı katmanlarını prompt injection, jailbreak, veri sızıntısı, araç kötüye kullanımı ve tedarik zinciri saldırılarına karşı koruyan mühendislik disiplinidir. Klasik uygulama güvenliğinin temellerini, dil modellerine özgü risklerle birleştirir.

Prompt injection neden en kritik LLM güvenliği riski sayılıyor?

Çünkü dil modeli, sistem talimatı ile güvenilmeyen kullanıcı veya belge içeriğini aynı bağlamda okur ve ikisini kesin olarak ayırt edemez. Saldırgan bu belirsizliği kullanarak modele talimatları atlatabilir, gizli bilgi sızdırabilir veya araçları istenmeyen eylemler için tetikleyebilir. OWASP LLM Top 10 listesinde LLM01 olarak ilk sırada yer alır.

LLM güvenliği ile yapay zekâ güvenliği aynı şey mi?

LLM güvenliği, daha geniş yapay zekâ güvenliği (AI security) şemsiyesinin dil modellerine odaklanan alt dalıdır. Yapay zekâ güvenliği görüntü, ses ve klasik makine öğrenmesi sistemlerini de kapsarken; LLM güvenliği özellikle chatbot, RAG ve AI agent uygulamalarındaki prompt injection, jailbreak ve araç kötüye kullanımı gibi metin tabanlı tehdit yüzeyine odaklanır.

Bir LLM uygulaması nasıl güvenli hale getirilir?

Önce model, veri kaynakları, RAG katmanı, araçlar, kimlikler ve yetki sınırlarını içeren bir envanter çıkarın. Ardından mimariye özgü tehdit modeli, en az yetki, güvenilmeyen bağlamın ayrıştırılması, çalışma zamanı guardrail'leri, çıktı doğrulaması, loglama ve tekrarlanabilir güvenlik regresyon testleri uygulayın. Tek bir filtre veya sistem promptu güvenlik sınırı değildir.

Türkçe LLM güvenliğinin İngilizceden farkı nedir?

Türkçe eklemeli bir dildir; İngilizce blocklist ve guardrail'ler Türkçe saldırı varyantlarını çoğu zaman kaçırır. Morfolojik türetme, noktasız 'ı' casefold farkları ve yerel otorite bağlamları İngilizce araçlarda kapsanmayan bypass yüzeyleri oluşturur. Ayrıca TCKN, IBAN ve VKN gibi Türkiye'ye özgü PII tipleri KVKK açısından ayrı tespit ve maskeleme gerektirir.

Kaynaklar ve kanıt sınırı

Bu sayfa bir kaynak dizinidir; güvenlik garantisi değildir. Sonuçlar değerlendirilen mimari, model, veri, araç, yapılandırma ve tehdit kapsamına bağlıdır. Güvenlik kontrolleri her önemli model veya mimari değişikliğinden sonra yeniden test edilmelidir.