Model Yükseltmelerinde
Güvenlik Regresyonu Nasıl Kurulur?
Yeni model daha doğru cevap verebilir ve aynı anda daha kolay yönlendirilebilir olabilir. Kalite benchmark’ı yükseldi diye prompt injection, veri sızıntısı veya tool misuse riskinin azaldığını varsayamayız.
Önce Değişiklik Birimini Tanımlayın
“Modeli yükselttik” çoğu zaman birden fazla değişikliği saklar: model snapshot, system prompt, safety ayarı, tool şeması, RAG indeksi, reranker, SDK ve gateway politikası aynı release içinde değişmiş olabilir. Regresyon sonucu bozulduğunda hangi değişikliğin etkili olduğu bilinmez.
AI release manifesti bu bileşenlerin her birini sürüm veya hash ile kaydetmelidir. Mümkünse bir rollout’ta tek güvenlik açısından anlamlı değişken değiştirilir; değilse faktörler ayrı deney kollarında karşılaştırılır.
Güvenlik Baseline’ı Başarı Oranından Fazlasıdır
Tek bir “attack success rate” metriği teşhis için yetersizdir. Baseline; normal görev başarısı, prompt injection direnci, sensitive-data leakage, tool policy uyumu, tenant izolasyonu, refusal kalitesi, latency ve maliyet ölçülerini birlikte taşımalıdır.
Test seti yalnızca bilinen saldırıları değil, bunlara yakın meşru talepleri de içermelidir. Aksi halde daha çok engelleyen model güvenli sanılırken ürün kullanılabilirliği düşer. Boundary pair yaklaşımı bu nedenle güçlüdür: aynı senaryodaki benign ve attack davranışı birlikte ölçülür.
Agent Sisteminde Final Cevap Yerine Trace Karşılaştırın
Agent aynı son cevaba farklı tool yollarıyla ulaşabilir. Yeni sürüm daha geniş veri çekiyor, daha fazla tool deniyor veya onay adımını atlıyor olabilir. Güvenlik regresyonu plan, goal event, tool call, argüman, onay ve sonuç event’lerini karşılaştırmalıdır.
Framework adapter’ı kanıtı doğru yerden toplamalıdır. OpenAI Agents için açık goal event, LangGraph için desteklenen update-stream yolu gibi framework-aware kayıtlar, metinden niyet tahminine göre daha deterministik sonuç verir.
Rollout Kapısı Nasıl Tasarlanır?
| Sonuç | Eylem |
|---|---|
| Kritik kontrol yeni ihlal üretti | Release bloklanır |
| Güvenlik aynı, normal görev kalitesi düştü | Ürün sahibi incelemesi |
| Belirsiz veya not_assessed arttı | Harness/telemetri düzeltmesi |
| Düşük riskli sinyal küçük sapma gösterdi | Canary ve yakın izleme |
| Tüm kapılar geçti | Kademeli rollout ve rollback hazır |
Offline Eval Tek Başına Yeterli Değildir
Offline set deterministik karşılaştırma sağlar; üretim dağılımını tam temsil etmez. Başarılı eval sonrasında düşük trafik canary, shadow değerlendirme veya yalnızca log üreten savunma modu kullanılabilir. Burada gerçek kullanıcı verisi için minimizasyon ve erişim kontrolü korunmalıdır.
Canary süresince yeni model ile eski modelin güvenlik sinyalleri, refusal farkları, tool kullanım hacmi ve hata oranı karşılaştırılır. Rollback teknik olarak test edilmemişse yalnızca plandır.
Karşılaştırmayı Tekrarlanabilir Hale Getirin
Eski ve yeni sürüm aynı veri seti snapshot’ı, system prompt, tool mock’ları ve retry politikasıyla çalıştırılmalıdır. Sağlayıcı destekliyorsa seed sabitlenir; temperature ve diğer örnekleme ayarları manifestte tutulur. Böylece altyapı farkının model davranışı gibi yorumlanması önlenir.
Üretken modeller tamamen deterministik olmayabilir. Kritik senaryoları birden fazla kez çalıştırıp sonuç dağılımını, güven aralığını ve en kötü davranışı birlikte raporlamak tek denemelik pass/fail kararından daha güvenilirdir. Harness hatası, timeout ve not_assessed sonuçları güvenlik bulgusuyla aynı sepete konulmamalıdır.
Her koşu; model ve veri seti kimliği, artefakt hash’leri, politika sürümü, zaman damgası ve ham olmayan karar kanıtıyla değişmez bir sonuç paketi üretmelidir. Bağımsız bir incelemeci aynı girdilerle karşılaştırmayı yeniden çalıştıramıyorsa rollout kapısı denetlenebilir değildir.
Minimum Regresyon Pipeline’ı
- Release manifestini üret ve tüm AI artefaktlarını sabitle.
- Benign/attack çiftli güvenlik eval setini çalıştır.
- Agent trace ve tool policy kontrollerini doğrula.
- Sonuçları önceki onaylı baseline ile karşılaştır.
- Belirsiz ve hata sonuçlarını finding’den ayır.
- Risk kapısına göre blokla, canary’ye al veya yayınla.
- Canlı telemetri ve rollback tatbikatıyla süreci kapat.
Kaynaklar ve Kanıt Sınırı
- OWASP Agent Security Regression Harness
- OWASP AI Engineering Primer
- NIST AI RMF Generative AI Profile
Bu yazı Enes Deniz tarafından hazırlanmış bağımsız bir teknik değerlendirmedir. Bağlantılı upstream proje veya standart kuruluşu tarafından yayımlanmış ya da onaylanmış bir metin değildir. Merge, test ve kapsam iddiaları yukarıdaki birincil kayıtlara bağlanmıştır.
