Laboratuvar: Türkçe saldırı ve savunma verisi üreten simülasyon ortamı
AltaySec Laboratuvarı kontrollü bir simülasyon ortamıdır. Saldırgan bir yapay zekâ Türkçe saldırı senaryoları üretir, savunan bir yapay zekâ bunları karşılamaya çalışır, ayrı bir hakem sonucu puanlayıp etiketler. Kalite kontrolünden geçen çıktılar sürümlenir; Gözcü veri katmanını ve güvenlik testlerimizi besler.
- Yöntem
- Red ve Blue yapay zekâ simülasyonu
- Puanlama
- Ayrı hakem katmanı
- Çıktı
- Etiketli, sürümlü Türkçe güvenlik verisi
- Eşleme
- OWASP, MITRE ATLAS, NIST, KVKK m.12
Üç rol
Simülasyonda her rolün tek bir görevi vardır. Hakem taraf tutmaz ve iki tarafa da strateji önermez.
Saldırgan yapay zekâ
Kurum kimliğine bürünme, morfolojik kaçınma ve Türkçe ile İngilizce karışık yazım gibi tekniklerle yeni Türkçe saldırı varyantları üretir ve savunmayı zorlar.
Savunan yapay zekâ
Saldırıyı karşılamaya çalışır: reddeder, tuzağı fark eder ya da düşer. Her sonuç savunmanın nerede kırıldığını gösterir.
Hakem
Yalnız sonucu puanlar ve sonucu etiketli, standart eşlemeli bir veri kaydı olarak yazar.
Veri motoru nasıl işler
Dört adımlı, tekrarlanabilir bir akış. Çıktısı kalite kontrolünden geçmiş, etiketli ve sürümlü Türkçe güvenlik verisidir.
-
Üretim
Saldırgan yapay zekâ güncel Türkçe tekniklerle yeni saldırı varyantları üretir.
-
Savunma
Savunan yapay zekâ saldırıyı karşılar; kırılma noktası gerçek davranışla ölçülür.
-
Puanlama
Hakem sonucu puanlar; kaydı OWASP, MITRE ATLAS, NIST ve KVKK m.12 ile etiketler.
-
Aktarım
Kalite kontrolünden geçen kayıt ekip onayıyla Gözcü'ye eklenir.
Çalışma ilkeleri
Laboratuvar verisinin testlerde ve ürünlerde kullanılabilmesi için sonuçların karşılaştırılabilir ve izlenebilir olması gerekir.
Tekrarlanabilir ve kontrollü
Senaryo, model, dil ve kazanma koşulları kayıt altına alınır. Sonuçlar karşılaştırılabilir, veri sürümleri geriye dönük incelenebilir.
Tarafsız ve denetlenebilir
Hakem katmanı iki taraf için de strateji üretmez, yalnız sonucu puanlar. Her kayıt standart eşlemeli ve izlenebilir biçimde saklanır.
Türkçe ve yerel
Üretilen saldırılar kurum kimliğine bürünme, morfolojik kaçınma ve karışık dil gibi Türkçeye özgü teknikleri içerir.
Laboratuvardan ürüne
Değer tek bir veri dosyasında değil; senaryo üretimi, hakemli etiketleme, kalite kontrolü, standart eşleme ve sürümlemenin birlikte çalışmasındadır. Bu zincir, Guardian'ın ve güvenlik testlerimizin aynı Türkçe tehdit bilgisine dayanmasını sağlar.
- Gözcü
- Kayıtları derler, standartlarla eşler ve sürümler.
- LLM sızma testi
- Testlerde kullanılan güncel Türkçe saldırı senaryoları.
- Guardian
- Prompt injection tespit kurallarının geliştirilmesi ve sınanması.
Çarpışma analizleri
Arena kayıtlarından çıkardığımız bulguları açık erişimli yazılar olarak yayımlıyoruz.
Kurumunuza özel bir red team veri programını birlikte değerlendirelim
Laboratuvar verisiyle beslenen ürünlerimizi inceleyin ya da kurumunuzun ihtiyacına göre bir program kapsamını birlikte çıkaralım.