Laboratuvar: Türkçe saldırı ve savunma verisi üreten simülasyon ortamı

AltaySec Laboratuvarı kontrollü bir simülasyon ortamıdır. Saldırgan bir yapay zekâ Türkçe saldırı senaryoları üretir, savunan bir yapay zekâ bunları karşılamaya çalışır, ayrı bir hakem sonucu puanlayıp etiketler. Kalite kontrolünden geçen çıktılar sürümlenir; Gözcü veri katmanını ve güvenlik testlerimizi besler.

Yöntem
Red ve Blue yapay zekâ simülasyonu
Puanlama
Ayrı hakem katmanı
Çıktı
Etiketli, sürümlü Türkçe güvenlik verisi
Eşleme
OWASP, MITRE ATLAS, NIST, KVKK m.12

Üç rol

Simülasyonda her rolün tek bir görevi vardır. Hakem taraf tutmaz ve iki tarafa da strateji önermez.

Saldırgan yapay zekâ

Kurum kimliğine bürünme, morfolojik kaçınma ve Türkçe ile İngilizce karışık yazım gibi tekniklerle yeni Türkçe saldırı varyantları üretir ve savunmayı zorlar.

Savunan yapay zekâ

Saldırıyı karşılamaya çalışır: reddeder, tuzağı fark eder ya da düşer. Her sonuç savunmanın nerede kırıldığını gösterir.

Hakem

Yalnız sonucu puanlar ve sonucu etiketli, standart eşlemeli bir veri kaydı olarak yazar.

Veri motoru nasıl işler

Dört adımlı, tekrarlanabilir bir akış. Çıktısı kalite kontrolünden geçmiş, etiketli ve sürümlü Türkçe güvenlik verisidir.

  1. Üretim

    Saldırgan yapay zekâ güncel Türkçe tekniklerle yeni saldırı varyantları üretir.

  2. Savunma

    Savunan yapay zekâ saldırıyı karşılar; kırılma noktası gerçek davranışla ölçülür.

  3. Puanlama

    Hakem sonucu puanlar; kaydı OWASP, MITRE ATLAS, NIST ve KVKK m.12 ile etiketler.

  4. Aktarım

    Kalite kontrolünden geçen kayıt ekip onayıyla Gözcü'ye eklenir.

Çalışma ilkeleri

Laboratuvar verisinin testlerde ve ürünlerde kullanılabilmesi için sonuçların karşılaştırılabilir ve izlenebilir olması gerekir.

Tekrarlanabilir ve kontrollü

Senaryo, model, dil ve kazanma koşulları kayıt altına alınır. Sonuçlar karşılaştırılabilir, veri sürümleri geriye dönük incelenebilir.

Tarafsız ve denetlenebilir

Hakem katmanı iki taraf için de strateji üretmez, yalnız sonucu puanlar. Her kayıt standart eşlemeli ve izlenebilir biçimde saklanır.

Türkçe ve yerel

Üretilen saldırılar kurum kimliğine bürünme, morfolojik kaçınma ve karışık dil gibi Türkçeye özgü teknikleri içerir.

Laboratuvardan ürüne

Değer tek bir veri dosyasında değil; senaryo üretimi, hakemli etiketleme, kalite kontrolü, standart eşleme ve sürümlemenin birlikte çalışmasındadır. Bu zincir, Guardian'ın ve güvenlik testlerimizin aynı Türkçe tehdit bilgisine dayanmasını sağlar.

Gözcü
Kayıtları derler, standartlarla eşler ve sürümler.
LLM sızma testi
Testlerde kullanılan güncel Türkçe saldırı senaryoları.
Guardian
Prompt injection tespit kurallarının geliştirilmesi ve sınanması.

Çarpışma analizleri

Arena kayıtlarından çıkardığımız bulguları açık erişimli yazılar olarak yayımlıyoruz.

Kurumunuza özel bir red team veri programını birlikte değerlendirelim

Laboratuvar verisiyle beslenen ürünlerimizi inceleyin ya da kurumunuzun ihtiyacına göre bir program kapsamını birlikte çıkaralım.