Alıcı Rehberi · AI Red Team Tedariki

AI Red Team Hizmeti Nasıl Seçilir? Sağlayıcıya Sorulacak 10 Soru
Satın alma öncesi değerlendirme çerçevesi — 2026 rehberi

Türkiye'de "yapay zeka sızma testi" artık ayrı bir ticari kategori; sağlayıcılar sayfa açtı, teklifler gelmeye başladı. Ama hangi sağlayıcının Türkçe üretim trafiğinizi gerçekten temsil edebileceğini ayıran bir seçim çerçevesi henüz ortada yok. Bu rehber, teklif almadan önce masaya koymanız gereken 10 soruyu veriyor.

AI Red Team Hizmeti Seçimi Nedir?

AI red team hizmeti seçimi, bir yapay zeka güvenlik sağlayıcısının test kapsamını, kullandığı saldırı kütüphanesinin dil kapsamasını, çerçeve uyumunu (OWASP LLM Top 10, MITRE ATLAS, NIST AI RMF), kanıt üretimini ve düzeltme doğrulamasını önceden tanımlanmış kriterlere göre karşılaştırarak; üretim ortamınızdaki gerçek yapay zeka riskini temsil edebilecek tedarikçiyi belirleme sürecidir. Klasik sızma testi tedarikinden farkı, saldırı yüzeyinin ağ veya kod değil, dil ve model davranışı olmasıdır; bu da sağlayıcının hangi dilde ve hangi saldırı kalıplarıyla test ettiğini birinci sınıf bir seçim kriteri hâline getirir.

Kısacası bu bir satın alma kararıdır. "AI red team nedir" sorusu bilgi niyetlidir; bu rehber ise teklif toplama, karşılaştırma ve sözleşme aşamasındaki alıcıya yöneliktir. Red team'in tanımını ve mekaniğini daha önce AI Red Teaming Nedir yazısında ele almıştık; burada odak, doğru sağlayıcıyı ayırmak.

Neden Artık Bir Seçim Rehberine İhtiyaç Var?

Türkiye'de yapay zeka güvenlik testi, birkaç yıl önce danışmanların yan hizmeti olarak sunulurken bugün başlı başına bir hizmet kalemine dönüştü. Privia Security, ofansif hizmetler menüsüne ayrı bir yapay zeka sızma testi başlığı ekledi; İnvekor gibi sağlayıcılar LLM güvenlik testlerini hizmet portföyüne aldı. Kategori olgunlaştı.

Ancak olgunlaşan tek şey arz tarafı. Alıcı tarafında "hangi sağlayıcı benim işim için doğru" sorusunu cevaplayan bir karşılaştırma çerçevesi neredeyse yok. Bir SEO danışmanlığı ya da klasik pentest için onlarca karşılaştırma yazısı bulunurken, yapay zeka red team tedarikinde alıcı büyük ölçüde sağlayıcının kendi pazarlama diline mahkûm. Bu asimetri, yanlış tedarikçi seçimine ve daha kötüsü, "test edildi" damgası taşıyan ama gerçek riski hiç görmemiş sistemlere yol açıyor.

Aşağıdaki 10 soru, tam da bu boşluğu kapatmak için tasarlandı. Her biri, teklif metnine değil, sağlayıcının yöntemine dokunur.

Sağlayıcıya Sorulacak 10 Soru

Sıralama tesadüf değil: en üstteki kriter, Türkçe çalışan bir kurum için en belirleyici olanıdır.

#KriterSağlayıcıya sorulacak soru
1Türkçe saldırı kapsamasıSaldırı kütüphaneniz Türkçe payload içeriyor mu, yoksa İngilizce setin çevirisi mi? Türkçe'ye özgü morfolojik ve kültürel bypass kalıplarını test ediyor musunuz?
2Kapsam katmanlarıYalnızca modeli mi, yoksa uygulama katmanını, RAG hattını, araç/agent yetkilerini ve sistem promptunu da mı test ediyorsunuz?
3Çerçeve uyumuBulgularınızı OWASP LLM Top 10, MITRE ATLAS ve NIST AI RMF ile eşliyor musunuz? Hangi teknik hangi maddeye karşılık geliyor?
4Manuel–otomatik dengeTestin ne kadarı otomatik tarayıcı, ne kadarı uzman elle keşif? Yeni saldırı kalıplarını nasıl üretiyorsunuz?
5Kanıt ve tekrar-üretilebilirlikHer bulgu için tam konuşma dökümü, payload ve tekrar üretme adımları veriyor musunuz?
6Yeniden testDüzeltmelerden sonra ücretsiz yeniden test var mı? Düzeltmeyi nasıl doğruluyorsunuz?
7Raporlama kalitesiRapor teknik ekibe ve yönetime aynı anda hitap ediyor mu? Bulgular iş etkisine çevriliyor mu?
8KVKK ve veri işlemeTest verisi nerede işleniyor? Bize ait veriler ve konuşma kayıtları test sonrası nasıl imha ediliyor?
9Üretim güvenliğiTest, canlı sistemi bozmadan mı yürütülüyor? İzolasyon, hız sınırı ve geri alma prosedürleriniz neler?
10Ekip yetkinliği ve güncellikEkip yapay zekaya özgü mü yoksa klasik pentester mı? Tehdit kütüphanenizi ne sıklıkla güncelliyorsunuz?

Bir sağlayıcı bu on soruya net, yazılı ve örnekli cevap veremiyorsa, aldığınız hizmet muhtemelen bir güvenlik değerlendirmesi değil, bir uyum kutusu işaretlemesidir.

Kritik Kriter: Türkçe Saldırı Kapsaması

Listedeki tüm kriterler önemli, ama birincisi diğerlerinin önüne geçer. Nedeni basit: bir yapay zeka sistemi hangi dilde konuşuyorsa o dilde kırılır. Saldırı yüzeyi ağ paketi değil, cümledir; ve cümlenin dili değişince saldırının biçimi de değişir.

AltaySec'in kendi ölçüm ortamı olan guardrail-arena iç değerlendirmesinde, İngilizce veri üzerinde eğitilmiş jailbreak sınıflandırıcılarının Türkçe saldırıların önemli bir bölümünü — iç benchmark bulgumuza göre yaklaşık %83'ünü — kaçırdığını gözlemledik. Bunu bir sektör ortalaması ya da dışarıda ölçülmüş bir oran olarak değil, AltaySec'in kendi iç ölçümü olarak paylaşıyoruz; kesin oran korunan modele ve kural setine göre değişir. Yine de yön nettir: İngilizce payload setiyle test eden bir sağlayıcı, Türkçe üretim trafiğini temsil edemez.

Bunun pratik sonucu şu: bir sağlayıcı "OWASP LLM Top 10 kapsamında test ediyoruz" dediğinde bile, o testin dili İngilizceyse, Türkçe kullanıcı tabanınızın karşı karşıya olduğu gerçek riskin büyük kısmı görülmeden kalır. Türkçe'ye özgü saldırı kalıplarının neden ayrı bir kütüphane gerektirdiğini Türkçe prompt injection saldırı kalıpları ve morfolojik bypass yazılarında ayrıntılandırdık.

Bu yüzden birinci soru, aynı zamanda en kolay elenme sorusudur: sağlayıcıdan üç Türkçe saldırı örneği isteyin. Çeviri kokan, kalıpları İngilizceden aktarılmış örnekler geldiğinde, geri kalan dokuz kriteri konuşmaya bile gerek kalmaz.

Çerçeve Uyumu ve Kanıt: Pazarlamayı Yöntemden Ayırmak

İkinci ayrım noktası, sağlayıcının bulgularını tanınmış bir çerçeveye oturtup oturtamadığıdır. OWASP LLM Top 10 uygulama katmanı risklerini, MITRE ATLAS saldırgan tekniklerini, NIST AI RMF ise yönetişim ve risk yaşam döngüsünü çerçeveler. İyi bir rapor, her bulguyu bu haritalardan en az birine bağlar; böylece bulgu izlenebilir ve denetlenebilir olur.

Çerçeve kadar önemli olan, kanıttır. "Sisteminiz prompt injection'a açık" cümlesi tek başına bir bulgu değil, bir iddiadır. Bulgu; tam konuşma dökümü, kullanılan payload ve adım adım tekrar üretme talimatıyla gelir. Kanıtın tekrar-üretilebilir olması, hem düzeltmeyi mümkün kılar hem de yeniden testte düzeltmenin gerçekten işe yaradığını doğrulamanızı sağlar. Bu disiplinin nasıl kurulduğunu LLM uygulama testi playbook yazısında paylaştık.

Otomasyon burada dikkatli okunmalı: tarayıcılar geniş kapsama sağlar ama güvenilirlikleri yönetilmezse yanlış güven üretir. Otomasyonun sınırlarını red team otomasyonu ve güvenilirlik mühendisliği yazısında tartıştık. Sağlıklı bir sağlayıcı, otomasyonu kapsam için, uzman keşfini ise derinlik için kullanır ve bu dengeyi açıkça anlatır.

Değerlendirmede Kırmızı Bayraklar

Bazı sinyaller, teklif daha imzalanmadan sağlayıcıyı elemenizi gerektirir:

  • Yalnızca otomatik tarayıcı çıktısı. Rapor bir aracın ham çıktısıysa ve insan yorumu yoksa, aldığınız şey değerlendirme değil, günlük dosyasıdır.
  • Çeviri kokan Türkçe payload'lar. Türkçe örnekleri İngilizceden birebir aktarılmışsa, gerçek Türkçe saldırı yüzeyi test edilmiyor demektir.
  • Kanıtsız bulgular. Konuşma dökümü ve tekrar üretme adımı olmayan hiçbir bulguyu düzeltemez, doğrulayamazsınız.
  • Yeniden testin olmaması ya da ayrı ücretlendirilmesi. Düzeltmenin doğrulanmadığı bir test, kapatılmamış bir döngüdür.
  • KVKK'ya değinmeyen veri işleme. Test sırasında sisteminize giren ve çıkan veriler kişisel veri içerebilir; sağlayıcının imha ve işleme politikası netleşmeden veri paylaşılmamalıdır. Konuyu KVKK ve LLM güvenliği yazısında ele aldık.
  • Süperlatif pazarlama. "Piyasadaki en iyi", "tek gerçek" gibi kanıtsız üstünlük iddiaları, yöntemin değil pazarlamanın öne çıktığının işaretidir.

Türkiye'deki mevcut sağlayıcı manzarasını ve hangi kurumların bu alanda konumlandığını Türkiye yapay zeka güvenliği şirketleri yazısında derledik.

Karar Çerçevesi ve Sonraki Adım

Pratik bir karar akışı şöyle işler. Önce birinci soruyla eleyin: Türkçe kapsaması yoksa, sağlayıcı listede kalmaz. Ardından kapsam katmanlarını (2) ve çerçeve uyumunu (3) doğrulayın; bu ikisi hizmetin teknik derinliğini belirler. Sonra kanıt, yeniden test ve raporlama (5–7) ile teslimatın işinize dönüşüp dönüşmeyeceğini görün. Son olarak KVKK ve üretim güvenliği (8–9) ile riski yönetin.

Kısa bir kurum içi chatbot testi mi arıyorsunuz, yoksa agent yetkileri ve RAG hattı dahil geniş bir değerlendirme mi — bu, kapsam katmanı sorusunun cevabını belirler. Kurumsal chatbot özelinde kapsamı kurumsal chatbot güvenlik testi yazısında ayrıştırdık.

AltaySec olarak red team hizmetimizi bu on kriter üzerine kuruyoruz: Türkçe saldırı kütüphanesi, OWASP/ATLAS/NIST eşlemesi, tam kanıt dökümü ve düzeltme doğrulaması. Test sonrası kalıcı savunma için bulguları Guardian (LLM güvenlik duvarı) ile çalışma zamanına taşıyoruz; böylece red team çıktısı bir rapor olmaktan çıkıp sürekli bir savunmaya dönüşüyor. Kendi sisteminiz için bu çerçeveyi konuşmak isterseniz iletişim bölümünden ulaşabilirsiniz.

Özetle: doğru sağlayıcıyı seçmenin yolu, teklif metnini değil, yöntemi sorgulamaktan geçer. On soru, tam da bu sorgulamanın sözleşme öncesi hâlidir.

Kaynaklar

İlgili Yazılar