AI Güvenlik Rolleri · Karşılaştırma

AI Kırmızı Takım vs Mavi Takım vs Mor Takım
Yapay zeka güvenliğinde rollerin karşılaştırması

Klasik siber güvenlikte kırmızı takım saldırır, mavi takım savunur, mor takım ikisini aynı masaya oturtur. Yapay zeka sistemlerinde bu üç rolün hedefi, araç seti ve başarı ölçütü değişiyor — çünkü saldırı yüzeyi artık kodda değil, dilde.

Kırmızı, mavi ve mor takım nedir?

Kırmızı takım bir sistemin saldırgan bakış açısıyla test edildiği ekiptir: gerçek bir düşmanın yapacağı gibi zafiyetleri bulmaya, sömürmeye ve savunmayı aşmaya çalışır. Mavi takım savunma tarafıdır: tespit, izleme, olaya müdahale ve sertleştirmeden sorumludur. Mor takım ayrı bir kalıcı ekip olmaktan çok bir çalışma biçimidir; kırmızı ve mavi takımı aynı masaya oturtarak her saldırı denemesini anında bir savunma iyileştirmesine dönüştüren geri besleme döngüsünü kurar. Bu üçlü ayrım Türkiye'deki güvenlik pratiğinde de yerleşmiştir ve bu yazıda klasik tanımı yapay zeka bağlamına taşıyoruz.

Yapay zekada roller kavramsal olarak aynı kalır, ama hedef sistem değişir. Artık test edilen şey bir web uygulaması ya da ağ değil; büyük dil modeli (LLM), onun etrafındaki bilgi getirme (RAG) katmanı ve araç çağıran ajanlardır. Bu, üç rolün de araç setini ve başarı ölçütünü yeniden tanımlar.

Yapay zekada bu roller neden farklılaşıyor?

Klasik sızma testinde saldırı yüzeyi büyük ölçüde belirlidir: portlar, uç noktalar, kütüphane sürümleri. Yapay zekada saldırı yüzeyi dilin kendisidir. Bir saldırgan kod yazmadan, yalnızca dikkatlice kurgulanmış bir cümleyle sistem yönergesini geçersiz kılmaya, gizli talimatları sızdırmaya ya da bir aracı kötüye kullandırmaya çalışabilir. Üç temel fark:

  • Girdi doğal dildir. Aynı amaç sonsuz farklı ifadeyle denenebilir; imza tabanlı tek bir kural saldırının tamamını kapatmaz.
  • Savunma olasılıksaldır. Model deterministik bir kod bloğu değildir; aynı istem iki kez farklı yanıt verebilir, bu yüzden başarı tek denemeyle değil oranla ölçülür.
  • Dil bir zafiyet ekseni haline gelir. İngilizce bloke edilen bir saldırı Türkçe morfoloji, çeviri bahanesi ya da kod karıştırma ile geçebilir. Bu, Türkçe konuşan ekipler için hem risk hem de avantajdır.

Bu üç fark, geleneksel kırmızı/mavi/mor iş bölümünü olduğu gibi kopyalamayı imkânsız kılar. Kavram aynı, uygulama katmanı yeniden yazılmalıdır. Yapay zeka özelinde saldırgan disiplinin ne olduğunu daha ayrıntılı ele aldığımız AI red teaming nedir yazısı bu bölümün doğal devamıdır.

Karşılaştırma tablosu: hedef, araç seti, çıktı, metrik

Aşağıdaki tablo, üç rolün yapay zeka bağlamındaki dört boyutunu yan yana koyar. Bunu Türkçede alıntılanabilir bir referans olarak tasarladık.

BoyutKırmızı Takım (Saldırı)Mavi Takım (Savunma)Mor Takım (İşbirliği)
HedefSistem yönergesini aşmak, veri sızdırmak, ajanı kötüye kullandırmakSaldırıyı tespit etmek, engellemek, sistemi sertleştirmekHer saldırıyı bir savunma iyileştirmesine dönüştürmek
Araç setiPrompt injection payload'ları, jailbreak kalıpları, çeviri/kodlama bahaneleri, otomatik istem üreticilerGiriş/çıkış filtreleri, LLM güvenlik duvarı, tespit kuralları, telemetri ve günlüklemeOrtak alıştırma senaryoları, tekrar oynatılabilir saldırı korpusu, kırmızı-mavi düello platformu
ÇıktıDoğrulanmış zafiyet ve kanıt (bypass transkripti)Güncellenmiş kural seti, engellenen istek günlükleri, müdahale prosedürüSağlayıcı/saldırı direnç matrisi, kapatılan boşlukların izlenebilir kaydı
MetrikBypass başarı oranı, ilk kırılmaya kadar geçen deneme sayısıTespit/engelleme oranı, yanlış pozitif (aşırı-red) oranıBoşluktan kapatmaya geçiş süresi, tekrar test sonrası düşen bypass oranı

Dikkat çeken nokta: kırmızı takımın başarısı mavi takımın başarısızlığı değildir. Mor takım çerçevesinde bir bypass, ölçülmüş bir öğrenmedir. Kritik metrik ikisinin ortasındaki geçiş süresidir — bir zafiyetin bulunmasından kapatılmasına kadar geçen zaman.

AI Kırmızı Takım: neye saldırır?

Yapay zeka kırmızı takımı, klasik pentest ekibinin dijital muadili değildir; saldırı vektörleri tamamen dil ve bağlam üzerine kuruludur. OWASP LLM Top 10 ve MITRE ATLAS, bu saldırıların ortak dilini sağlar. Tipik hedefler:

  • Prompt injection: Doğrudan ya da belge/HTML/e-posta üzerinden dolaylı olarak modele gizli talimat enjekte etmek.
  • Sistem yönergesi sızdırma: Modeli, kendisine verilen gizli kuralları ifşa etmeye ikna etmek.
  • Jailbreak ve rol yapma: Güvenlik korkuluklarını bir kurgu, çeviri ya da nezaket eskalasyonu bahanesiyle aşmak.
  • Ajan kötüye kullanımı: Araç çağıran bir ajanı, yetkisi dışında eylem yapmaya yönlendirmek.

Yapay zekada kritik fark, aynı saldırının dilden dile farklı davranmasıdır. AltaySec olarak kendi ölçümlerimizde, İngilizcede engellenen bazı kalıpların Türkçe morfolojik varyasyonla ya da çeviri bahanesiyle geçebildiğini gözlemledik. Bu yüzden Türkçe konuşan bir kırmızı takım, salt İngilizce korpuslarla çalışan ekiplerin gözden kaçırdığı boşlukları erkenden bulabilir.

AI Mavi Takım: neyi savunur?

Mavi takımın işi, olasılıksal bir sistemin etrafına deterministik korkuluklar örmektir. Yapay zekada savunma tek katmanlı değildir; girdi ile model arasına, model ile çıktı arasına ve araç çağrılarının önüne ayrı denetim noktaları yerleştirilir. Temel savunma bileşenleri:

  • Giriş denetimi: Bilinen enjeksiyon kalıplarını, kodlama/karıştırma denemelerini ve şüpheli talimatları yakalayan filtreler.
  • Çıkış denetimi: Kişisel veri sızıntısı, sistem yönergesi ifşası ve politika ihlali için yanıtın taranması.
  • LLM güvenlik duvarı: Çalışma zamanında istekleri değerlendiren, engelleyen ve günlükleyen bir katman. AltaySec'in Guardian ürünü bu rolü üstlenir; çalışma zamanı korkuluklarının nasıl kurulduğunu runtime LLM guardrails yazısında ayrıntılandırdık.
  • Telemetri: Her engellenen ve geçen isteğin, mor takımın öğrenebileceği biçimde kaydedilmesi.

Mavi takımın en zor metriği tespit oranı değil, aşırı-red (yanlış pozitif) dengesidir. Aşırı agresif bir filtre meşru kullanıcıları da engeller; bu, güvenliğin sessizce kullanılabilirliği yediği bir başarısızlık biçimidir. İyi bir mavi takım, bypass oranını düşürürken aşırı-red oranını da izler.

AI Mor Takım: işbirliği döngüsü ve canlı bir örnek

Mor takım, kırmızı ve mavi arasındaki duvarı kaldırır. Amaç, saldırının bulunmasıyla savunmanın güncellenmesi arasındaki gecikmeyi sıfıra yaklaştırmaktır. Yapay zekada bu döngü otomatikleştirilebilir: bir saldırı korpusu bir model kümesine karşı sistematik olarak çalıştırılır, hangi saldırının hangi sağlayıcıda geçtiği kaydedilir ve sonuç doğrudan savunma kuralına dönüşür.

Bunun somut bir örneğini AltaySec'in kendi ölçüm ortamı olan AltayDuel arenasında ürettik. Yayımlanan anlık görüntüde (AltayDuel v0.1, Mart–Mayıs 2026, 297 düello) her saldırı kategorisinin farklı sağlayıcı modellerine karşı sonucu kaydedildi ve bundan bir sağlayıcı × saldırı direnç matrisi çıkarıldı. Bu matris tam olarak mor takım çıktısının ne olması gerektiğini gösterir: hangi modelin hangi saldırı sınıfına dirençli olduğunu, savunma kararı verilebilecek biçimde tek tabloda toplar. Kategori bazlı dökümü provider matrisi: hangi model hangi saldırıya dirençli yazısında paylaştık.

Buradaki rakamların AltaySec'in kendi arena ölçümü olduğunu, evrensel bir kıyaslama olmadığını vurgulayalım. Değeri de tam bu şeffaflıkta: transkriptler ve veri seti açık olduğu için başkaları tekrar oynatıp doğrulayabilir. Otomasyonlu bir kırmızı-mavi düellosunun neden güvenilirlik mühendisliği gerektirdiğini AI kırmızı takım otomasyonu yazısında tartıştık.

Rolleri kurarken: indirilebilir şablon

Üç rolü sıfırdan kurmanın en pahalı yanı, işin başında ne yapılacağının belirsizliğidir. Bunu azaltmak için standartlara bağlı, açık kaynaklı bir rol/görev şablonu yayımladık: llm-red-team-playbook. Kapsam ve yetkilendirmeden başlayıp tehdit modeli, keşif, OWASP LLM Top 10 test matrisi, kanıt toplama ve tekrar teste kadar giden aşamaları içerir. İçerdiği tek şey yöntem, kontrol listeleri ve rapor şablonudur — istismar kodu değildir ve yalnızca yazılı yetkiye dayalı test için tasarlanmıştır.

Pratik bir başlangıç sıralaması:

1. Yetki ve kapsamı yazılı sabitle (kırmızı takımın izin sınırı)
2. Tehdit modelini çıkar (hangi varlık, hangi saldırgan)
3. OWASP LLM Top 10 test matrisini uygula (kırmızı)
4. Her bulgu için tespit/engelleme kuralı yaz (mavi)
5. Bulgu-kapatma süresini ölç, tekrar test et (mor)
6. Sonucu matrise işle, döngüyü kapat

Uygulama katmanındaki testin adım adım nasıl yürütüldüğünü LLM uygulama testi playbook'u yazısında ele aldık.

Sonuç: aynı kavram, yeni katman

Kırmızı, mavi ve mor takım kavramları yapay zekada da geçerlidir; değişen şey, saldırı yüzeyinin dile kaymasıdır. Bu kayma üç sonucu beraberinde getirir: saldırı imza değil kalıp temellidir, savunma deterministik değil olasılıksaldır ve dilin kendisi bir zafiyet eksenidir. Türkçe konuşan ekipler için bu, hem daha erken bulunabilen boşluklar hem de yerelleştirilmiş savunma anlamına gelir.

En önemli metrik hangi takımın "kazandığı" değil, bir boşluğun bulunmasından kapatılmasına kadar geçen süredir. Mor takım tam da bu süreyi kısaltmak için vardır; AltayDuel'in sağlayıcı direnç matrisi de bu döngünün ölçülebilir bir çıktısıdır. Kendi ekibinizde bu döngüyü kurmak için değerlendirme yaptırmak isterseniz bizimle iletişime geçebilirsiniz.

Kaynaklar

İlgili Yazılar