AI Tedarik Zinciri · OWASP LLM03

Yapay Zeka Tedarik Zinciri Saldırısı
6 katmanlı saldırı haritası ve ATLAS eşlemesi

Bir LLM uygulamasına açılan en sessiz kapı, yazdığınız prompt değil; o modeli eğiten veri seti, indirdiğiniz ağırlık dosyası, kurduğunuz Python paketi ve ajanınıza taktığınız araçtır. Yapay zeka tedarik zinciri saldırısı, bu altı halkadan herhangi birine yerleştirilen güveni istismar eder.

Yapay Zeka Tedarik Zinciri Saldırısı Nedir?

Yapay zeka tedarik zinciri saldırısı, bir yapay zeka sisteminin ürettiği çıktıya değil; o sistemi ayakta tutan bileşenlerin köküne yerleştirilen kötü niyetli güvenin istismar edilmesidir. Saldırgan, hedefin prompt'una doğrudan dokunmak yerine; modeli eğiten veri setini, dağıtılan model ağırlıklarını, ince ayar adapter'larını, çağrılan Python paketlerini, ajanın taktığı araç ve skill'leri ya da çalışma zamanı ortamını zehirler. Böylece kod tabanına hiç dokunmadan, kurbanın kendi kurduğu bir bağımlılık üzerinden içeri girer.

Klasik yazılım tedarik zinciri saldırısından farkı, saldırı yüzeyinin yalnızca kod olmamasıdır: eğitim verisi, öğrenilmiş ağırlıklar ve doğal dilde tanımlanan araçlar da birer taşıyıcıdır. Bir backdoor bir .py dosyasında olabileceği gibi, bir model tensöründeki gizli tetikleyicide veya bir MCP aracının açıklama metnindeki gizli talimatta da olabilir. OWASP bu risk sınıfını LLM03: Supply Chain başlığı altında tanımlar; ajan (agentic) sistemlerdeki genişlemiş halini ise Agentic Security Initiative (ASI) taslak çalışması ele almaktadır.

Neden Klasik Tedarik Zincirinden Daha Zor?

Geleneksel yazılımda bir bağımlılığı denetlemek, kaynağı okumak ve imzayı doğrulamakla büyük ölçüde mümkündür. Yapay zekada üç yapısal fark bu güveni zorlaştırır:

  • Opak ağırlıklar: Bir model dosyası milyarlarca parametreden oluşur; içine gömülü bir arka kapıyı gözle okuyamazsınız. Zehirli bir veri örneği, ancak belirli bir tetikleyici geldiğinde davranışı değiştirir.
  • Doğal dil = yürütülebilir yüzey: Ajan mimarilerinde bir aracın açıklaması ya da bir skill dosyasının içeriği, modele verilen talimatın parçası hâline gelir. Yani metin, dolaylı prompt enjeksiyonu için bir yürütme kanalıdır.
  • Geçişli güven zinciri: Bir temel modeli, onun üzerine eğitilmiş adapter'ı, adapter'ı çağıran gateway'i ve gateway'i saran ajanı ayrı ayrı denetlemezseniz, en zayıf halkanın güveni tüm zincire yayılır.

Bu üç fark, savunmayı tek bir tarama noktasına değil; her katmanı ayrı bir güven sınırı olarak modellemeye zorlar.

Altı Katmanlı Saldırı Haritası

AltaySec'in tedarik zinciri modelinde saldırı yüzeyini altı sıralı katmana ayırıyoruz. Her katman, üstündeki katmana güven aktarır; dolayısıyla zehir en alttan girip yukarı doğru ilerler.

  1. Veri seti katmanı: Eğitim ya da RAG korpusuna zehirli/backdoor örnek enjekte etme. Tetikleyici bir kelime geldiğinde model önceden belirlenmiş çıktı üretir.
  2. Temel model katmanı: Hub üzerinden dağıtılan ağırlıkların değiştirilmesi, tipo-benzeri sahte model repoları, imzasız/provenance'ı olmayan checkpoint'ler.
  3. Adapter / LoRA katmanı: Küçük ince ayar dosyalarına gömülü davranış değişikliği. Küçük boyutu ve "zararsız" görünümü denetimi atlatmayı kolaylaştırır.
  4. Paket & AI-gateway katmanı: PyPI/npm bağımlılıklarına veya LiteLLM gibi model yönlendirici/gateway bileşenlerine yerleştirilen kod tabanlı arka kapılar.
  5. Araç / skill & MCP katmanı: Ajanın taktığı araçların, skill dosyalarının veya MCP sunucularının zehirlenmesi; aracın açıklamasına gizli talimat gömme.
  6. Dağıtım / çalışma zamanı katmanı: Konteyner imajı, ortam ve host seviyesinde istismar; ajan yürütmesinden host'a kaçış (Escape to Host).

Bu katmanlaşmanın pratik değeri, bir olayın hangi güven sınırında gerçekleştiğini net söyleyebilmenizdir: LiteLLM olayı 4. katmanda, ClawHub dalgası 5. katmanda yaşandı.

Katman → OWASP/ATLAS → Vaka Eşleme Tablosu

Aşağıdaki referans tablo, her katmanı OWASP LLM03 / ASI taslağı ve MITRE ATLAS teknikleriyle eşler; yanına 2025-2026'nın doğrulanmış vakalarını yerleştirir. Türkçe kaynaklarda az işlenen bu çapraz eşleme, bir olayı hızla sınıflandırmak için tasarlandı.

KatmanSaldırı MekanizmasıOWASP / ATLAS EşlemesiDoğrulanmış Vaka (2025-2026)
1. Veri setiZehirli / backdoor eğitim örneğiLLM03 · MITRE ATLAS AML.T0098 (Publish Poisoned Datasets)Zehirli veri seti yayımlama tekniği (ATLAS'ta katalogludur)
2. Temel modelAğırlık değiştirme, sahte repo, imzasız checkpointLLM03 · model provenance ihlaliProvenance/imza eksikliğinden kaynaklanan hub riskleri
3. Adapter / LoRAİnce ayar dosyasına gömülü davranışLLM03 · ASI taslağı (agentic tedarik zinciri)Adapter tabanlı gizli davranış vektörü
4. Paket & AI-gatewayBağımlılık/gateway arka kapısı, komut enjeksiyonuLLM03 · yazılım tedarik zinciriLiteLLM PyPI ele geçirme (backdoor'lu 1.82.7/1.82.8, Mart 2026) — ve ayrı olay: CVE-2026-42271 command injection (CVSS 8.7, CISA KEV)
5. Araç / skill & MCPZehirli araç/skill, gizli talimatlı açıklamaLLM03 · ASI taslağı · ATLAS "Publish Poisoned AI Agent Tool"ClawHub zararlı skill dalgası
6. Dağıtım / çalışma zamanıKonteyner/host istismarı, ajan yürütmesinden kaçışLLM03 · MITRE ATT&CK "Escape to Host" (T1611) — çalışma zamanı örüntüsüOtonom ajan yürütmesinden host'a kaçış senaryosu

Not: LiteLLM PyPI ele geçirme (tedarik-zinciri backdoor) ile CVE-2026-42271 (command injection) iki ayrı olaydır; aynı gateway ekosisteminde farklı zamanlarda ortaya çıktılar. CVE-2026-42271, PyPI ele geçirmesinin CVE'si değildir.

2026 Vakalarının Katmanlara Oturuşu

LiteLLM PyPI ele geçirme (4. katman). Yaygın kullanılan bir model gateway/yönlendirici olan LiteLLM'in PyPI sürümlerine (1.82.7 ve 1.82.8) arka kapı yerleştirildi. Kurbanlar zaten güvendikleri bir bileşenin yeni sürümünü kurarken içeri girildi; bu, klasik yazılım tedarik zinciri saldırısının yapay zeka gateway'ine taşınmış hâlidir. Aynı ekosistemde ayrıca CVE-2026-42271 adlı bir command injection zafiyeti (CVSS 8.7) CISA KEV kataloğuna girdi ve aktif sömürüldü. Bu iki olayı ayrı satırlarda tutmak, kök nedeni doğru raporlamak için kritiktir.

ClawHub zararlı skill dalgası (5. katman). Ajanlara doğal dille tanımlı yetenek ekleyen skill ekosistemine yönelik kötü amaçlı skill dalgası, aracın açıklama/tanım metninin bir yürütme kanalı olduğunu gösterdi. Burada saldırı ne bir CVE'ye ne de bir binary'ye dayanır; ajanın taktığı skill dosyasının içeriğine gizlenmiş talimattır. MITRE ATLAS'ın Şubat 2026'da katalogladığı "Publish Poisoned AI Agent Tool" tekniği tam olarak bu yüzeyi tarifler.

Otonom ajan ihlali (6. katman). Araç zincirini kontrol eden bir ajanın, yürütme ortamından host seviyesine sızması (Escape to Host), tedarik zinciri riskinin çalışma zamanına kadar uzandığını gösterir. Zehir 5. katmanda girer, 6. katmanda etki alanını genişletir.

Katman Bazlı Savunma Prensipleri

Altı katmanın her biri ayrı bir güven sınırı olduğundan, savunma da katman bazlı olmalıdır. Genel prensipler:

  • Veri & model provenance: Eğitim verisi ve model checkpoint'leri için kaynak, imza ve şema doğrulaması; imzasız ağırlıkları üretime almama. (AltaySec'in model-imzalama-ve-provenance notları bu adımı ele alır.)
  • Bağımlılık pinning & doğrulama: Paket ve gateway sürümlerini sabitleme, hash doğrulama, yeni sürümleri karantinaya alma. LiteLLM tipi olaylar tam da bu adım atlandığında bulaşır.
  • Araç/skill izolasyonu: Ajanın taktığı her aracı en az yetki (least agency) ile çalıştırma, açıklama metinlerini gizli talimata karşı tarama, MCP sunucularını denetleme.
  • Lethal trifecta kontrolü: Bir ajanda "özel veriye erişim + güvenilmez içerik + dışarı veri aktarımı" üçlüsü aynı anda birleşiyorsa alarm verme.
  • Çalışma zamanı izolasyonu: Konteyner sertleştirme, host kaçışına karşı sandbox ve çıkış (egress) kısıtları.

AltaySec tarafında bu prensipleri operasyonel hâle getiren açık kaynak varlıklar mevcut: ajan araç/skill katmanı için owasp-agentic-skills-top10-tr, MCP denetimi için mcp-security-checklist ve trifecta tespiti için lethal-trifecta-lint. Çalışma zamanında girdi/çıktıyı filtreleyen bir katman isteyenler için Guardian (LLM firewall), 4-6. katmanlardaki davranışsal anomalileri politika bazlı yakalamayı hedefler.

Türkçe Bağlamda Neden Ayrıca Ölçülmeli?

Tedarik zinciri saldırılarının çoğu dil-bağımsızdır; ancak 5. katmandaki gizli talimat enjeksiyonu (araç açıklaması, skill metni, dolaylı enjeksiyon) dil-bağımlı bir bileşen taşır. AltaySec'in kendi ölçümü olan AltayDuel Türkçe prompt enjeksiyon veri setinde ve guardrail-arena karşılaştırmalarında gözlemlediğimiz örüntü, İngilizce için ayarlanmış sınıflandırıcıların Türkçe morfolojik/örtük talimatları belirgin oranda kaçırabildiğidir. Bu, dış-genel bir gerçek değil; AltaySec'in kendi ölçüm verisidir ve tedarik zinciri savunmasının araç/skill katmanında Türkçe test edilmesi gerektiğine işaret eder.

Sonuç olarak: yapay zeka tedarik zinciri saldırısını tek bir "CVE tara" adımına indirgemek yanıltıcıdır. Altı katmanı ayrı güven sınırı olarak modelleyip her birini OWASP LLM03 ve MITRE ATLAS tekniklerine eşleyen bir haritaya sahip olmak; hem olayı doğru sınıflandırmayı hem de savunmayı doğru katmana yerleştirmeyi mümkün kılar.

Kaynaklar

İlgili Yazılar