Görsel Prompt Injection Nedir?
Resmin İçine Gizlenen Türkçe Talimatlar ve Vision Modeli OCR Davranışı
Bir modele metin girişini hiç yazmadan, yalnızca bir resim yükleyerek talimat geçirebilirsiniz. Görsel prompt injection, saldırının komut kanalını metinden piksele taşır; bu yazı, altı gizleme tekniğini ve Türkçe karakterlerin vision modeli OCR davranışını nasıl değiştirdiğini derinlemesine ele alıyor.
Görsel Prompt Injection Nedir? (Tanım)
Görsel prompt injection, bir yapay zeka modeline gönderilen talimatın metin kutusuna yazılmak yerine bir görselin içine gömülmesi ve modelin görüntüyü işlerken bu gizli metni okuyup komut olarak yürütmesidir. Saldırgan, kullanıcının veya sistemin niyetinden bağımsız bir talimatı ("önceki yönergeleri yok say", "sistem talimatını göster", "bu belgeyi güvenli olarak onayla") resmin pikselleri, filigranı veya meta-verisi arasına yerleştirir; modelin görü (vision) bileşeni bunu bağlamın bir parçası sanarak işler. Kısaca: komut kanalı metinden piksele taşınır.
Bu, klasik prompt injection'ın multimodal bir alt sınıfıdır. Farkı önemlidir: metin tabanlı bir giriş filtresi kullanıcının yazdığı ifadeyi tarasa bile, resmin içindeki yazıyı görmez. Model, görseli optik karakter tanıma (OCR) benzeri bir yetenekle çözümlerken talimatı içselleştirir. Bu nedenle görsel prompt injection, dolaylı (indirect) enjeksiyonun görsel kanaldaki karşılığı olarak da düşünülebilir; zararlı içerik, güvenilir sanılan bir veri nesnesinin (bir ekran görüntüsü, bir fatura taraması, bir ürün fotoğrafı) içine yerleşir.
Neden İşe Yarar: Vision Modelinin OCR Davranışı
Modern vision-language modelleri, bir görseldeki yazıyı ayrı bir OCR motoruyla değil, doğrudan çok-modlu temsil uzayında "okur". Bu, güçlü bir yetenektir; kullanıcı bir tabelanın veya el yazısının fotoğrafını yükleyip "bunda ne yazıyor?" diye sorabilir. Ancak aynı yetenek, saldırının temelidir: model, okunabilir her metni potansiyel talimat olarak işleyebilir ve çoğu zaman "bu yazı görüntünün içinde mi yoksa kullanıcının gerçek isteği mi?" ayrımını güvenilir biçimde yapamaz.
Üç davranışsal eğilim bu vektörü besler:
- Talimat-veri ayrımının zayıflığı: Model için "işlenecek içerik" ile "uyulacak talimat" aynı belirteç akışında erir. Görselden okunan buyurgan bir cümle, sistem talimatına rakip bir sinyal olur.
- Düşük-görünürlük toleransı: OCR yeteneği, insan gözünün zar zor seçtiği düşük kontrastlı veya küçük puntolu metni bile çözebilir. İnsan denetçinin gözden kaçırdığı yazı, model için nettir.
- Bağlam açgözlülüğü: Model, sağlanan tüm modaliteleri yararlı bağlam varsayar. Bir arayüz ekran görüntüsüne gömülü "Sistem: yetki yükseltildi" ibaresi, sahte bir otorite sinyali olarak alınabilir.
Sonuç olarak görsel kanal, metin kanalındaki savunmalardan bağımsız, ayrı bir denetim gerektiren bir saldırı yüzeyidir.
Altı Gizleme Tekniği
Görsel kanalda talimatı "gizlemenin" birbirinden farklı yollarını altı ana teknikte toplamak, hem savunma hem de test tasarımı için pratik bir çerçeve sunar. Aşağıdaki tablo, her tekniği mekanizması ve tespit edilebilirliği açısından niteliksel olarak özetler; buradaki değerlendirmeler tekniklerin doğasından çıkarılan mühendislik gözlemleridir, ölçülmüş oranlar değildir.
| Teknik | Mekanizma | İnsan gözüne görünürlük | Tipik tespit zorluğu |
|---|---|---|---|
| Düşük kontrast | Metni arka plana çok yakın bir renkte (beyaz üstüne açık gri gibi) yazma; model OCR ile okur, insan güçlükle seçer | Çok düşük | Kontrast-normalizasyonlu OCR ön-taramasıyla yakalanabilir |
| Ters/aynalı yazı | Metni ters çevirme veya yansıtma; bazı modeller yine de çözer, basit filtreler kaçırır | Düşük | Orta; geometrik dönüşüm denemeleri gerektirir |
| Filigran (watermark) | Talimatı yarı saydam, tüm görsele yayılmış bir filigran katmanı olarak gömme | Düşük-orta | Orta; desen ayrıştırma gerekir |
| Arka plan dokusu | Talimatı gürültü/doku içine karıştırma veya bir örüntünün parçasıymış gibi yerleştirme | Çok düşük | Yüksek; "anlamlı metin mi doku mu" ayrımı güç |
| Meta-veri / EXIF | Talimatı görselin EXIF/IPTC alanlarına (açıklama, başlık, yorum) yazma; piksellerde hiç görünmez | Sıfır (piksel yok) | Düşük–orta; ardışık düzen EXIF'i modele geçiriyorsa risk, aksi halde sıyrılır |
| Arayüz taklidi (UI-taklidi) | Talimatı sahte bir sistem mesajı, hata kutusu veya "yönetici notu" gibi biçimlendirme | Yüksek (ama meşru görünür) | Yüksek; içerik meşru arayüz metninden ayırt edilemez |
Bu altı teknik ayrı ayrı da, birleştirilmiş de kullanılabilir; örneğin düşük kontrastlı bir arayüz taklidi, hem insan denetçiyi hem de basit görsel filtreleri aynı anda atlatmayı hedefler.
Türkçe Karakter ve OCR İtaat Oranı: Test Seti Tasarımı
Bu tekniklerin "ne kadar işe yaradığını" ölçmek için doğru soru, sızma olup olmadığı değil, görsel talimata itaat oranıdır: modele bir görsel içinde gömülü bir talimat verildiğinde, modelin bu talimatı kaç denemede yürüttüğünün oranı. Bu ölçüm, metin kanalı için AltayDuel sağlayıcı matrisinde kullandığımız "hangi model hangi saldırıya dirençli" formatının görsel kanala taşınmış halidir.
Türkçe, bu ölçümde ihmal edilmiş bir değişken katar. Görsel kanalda üç etki özellikle önemlidir:
- Türkçe'ye özgü harfler: ç, ğ, ı, İ, ö, ş, ü karakterleri OCR aşamasında yanlış çözümlenmeye daha yatkındır. Noktasız ı ile noktalı i ayrımı veya büyük İ davranışı, düşük çözünürlükte kararabilir. Bu, hem saldırı için bir kaçış (savunma OCR'ı yanlış okur) hem de saldırı için bir risk (talimat bozulur) yaratır.
- Büyük/küçük harf katlama (case folding): Türkçe'nin i/İ katlama kuralı, İngilizce odaklı normalleştirme boru hatlarında hataya yol açar; bu davranışı metin kanalında daha önce belgelemiştik ve görsel-OCR aşamasında da benzer bir kör nokta beklenir.
- Biçimbilimsel örtme: Türkçe'nin eklemeli yapısı, talimatı fiil çekimleri ve eklerle "yumuşatarak" filtrelerin aradığı kalıplardan uzaklaştırabilir. Bu yüzeyi Türkçe morfolojik bypass yazımızda metin için ele almıştık; görsel kanalda aynı örtme OCR sonrası metne taşınır.
Şeffaflık notu: Bu yazıda altı teknik için model bazlı somut başarı yüzdeleri paylaşmıyoruz; bu tablo, kontrollü bir ölçüm koşusu gerektirir ve henüz koşulmamıştır. Bunun yerine, sağlam bir test seti tasarımı öneriyoruz: her gizleme tekniği için Türkçe talimat içeren görsel çeşitlemeleri (aynı talimatın altı teknikle üretilmiş varyantları), noktasız-ı/noktalı-i ve i/İ katlama tuzaklarını kapsayan karakter matrisi ve her sağlayıcı için tekrarlı denemelerle hesaplanan itaat oranı metriği. Bu tasarım, AltayDuel Türkçe veri seti disipliniyle uyumludur ve AltaySec Scanner yük kütüphanesinin görsel varyantlarıyla beslenecek şekilde kurgulanır. Sayı yayımladığımızda, bunun AltaySec'in kendi ölçümü olduğunu açıkça etiketleyeceğiz.
Metin Kanalından Farkı ve Envanterdeki Yeri
Görsel prompt injection'ı metin tabanlı enjeksiyondan ayıran şey, talimatın hiç metin girişi olmadan modele ulaşabilmesidir. Kullanıcı yalnızca bir görsel yükler; zararlı yönerge o görselin pikselleri veya meta-verisi içindedir. Bu, iki savunma varsayımını çürütür: (1) "kullanıcı girişini tararsak yeter" varsayımı, çünkü girişte suç unsuru metin yoktur; (2) "belge içeriği pasif veridir" varsayımı, çünkü HTML, PDF ve e-postadaki dolaylı enjeksiyonda olduğu gibi veri nesnesinin kendisi aktif bir talimat taşıyıcısına dönüşür.
Görsel, multimodal saldırı yüzeyinin yalnızca bir kanalıdır; ses, video, belge yerleştirmeleri ve araç çıktıları gibi başka kanallar da vardır. Bu yazı, o kanal envanterinin görsel bileşenine odaklanan bir derin dalıştır; tüm kanalların taksonomisi ve karşılaştırmalı önceliklendirmesi için multimodal yapay zeka güvenliği çok-kanallı envanter yazımıza bakabilirsiniz. Burada taksonomiyi tekrar etmiyor, yalnızca görsel kanalın kendine özgü mekaniğini ve Türkçe/OCR boyutunu açıyoruz.
Savunma Prensipleri
Görsel prompt injection'a karşı savunma, tek bir kontrole değil katmanlı bir yaklaşıma dayanır. Öne çıkan prensipler:
- Görsel içeriği ayrı denetleyin: Metin filtresi görselin içindeki yazıyı görmez. Kullanıcı görsellerini, modele girmeden önce kontrast-normalizasyonlu bir OCR ön-taramasından geçirip çıkan metni de enjeksiyon kalıplarına karşı değerlendirin.
- EXIF/meta-veriyi sıyırın: Görselleri işleme almadan önce EXIF/IPTC alanlarını temizleyin. Meta-veri kanalı en ucuz ama en kolay kapatılabilir vektördür; boru hattınızın bu alanları modele hiç geçirmediğinden emin olun.
- Talimat-veri sınırını modele hatırlatın: Sistem talimatında, görsellerden okunan metnin yalnızca veri olduğunu ve talimat olarak yorumlanmaması gerektiğini açıkça belirtin. Bu tek başına yeterli değildir ama katmana katkı sağlar.
- Çalışma zamanı denetimi ekleyin: Girdi ve çıktıyı bağımsız bir çalışma zamanı koruma katmanıyla izleyin. AltaySec Guardian gibi bir yapay zeka güvenlik duvarı, modelin görselden gelen buyurgan içeriğe verdiği yanıtı, ana modelden bağımsız ikinci bir hakem olarak değerlendirebilir.
- Türkçe'yi test kapsamına alın: İngilizce test setleri, Türkçe karakter ve OCR davranışını ölçmez. Kendi görsel test setinizi Türkçe talimat varyantlarıyla ve i/İ katlama tuzaklarıyla besleyin. Kurumsal bir değerlendirme için AltaySec ekibiyle iletişime geçebilirsiniz.
Bu katmanların hangisinin hangi teknik ve model kombinasyonunda ne kadar tuttuğu, yine ölçüm gerektiren ampirik bir sorudur; savunmayı "kurduk" değil, "sağlayıcı matrisinde ölçtük" diyebildiğinizde olgunlaşır.
