Tedarik Zinciri & Model Provenance · OWASP LLM03

LoRA ve Adapter Güvenliği: İnce Ayar Eklentileri Guardrail'i Nasıl Devre Dışı Bırakır
Hizalama silme, red-oranı çöküşü ve Adapter Güven Sınıflandırması

Bir LoRA adapteri, temel modelin ağırlıklarına dokunmadan davranışını değiştirir; ama aynı mekanizma güvenlik hizalamasını da bir dosya kadar taşınabilir hale getirir. Üçüncü taraf bir adapter yüklemek, guardrail'i sessizce kapatabilen bir tedarik zinciri kararıdır.

LoRA ve Adapter Nedir, Neden Bir Güvenlik Yüzeyidir?

LoRA (Low-Rank Adaptation) ve genel olarak adapter tabanlı ince ayar, büyük bir dil modelinin milyarlarca parametresini yeniden eğitmeden, modele küçük ve düşük ranklı ek ağırlık matrisleri ekleyerek davranışını değiştiren bir yöntemdir. Temel modelin ağırlıkları dondurulur; öğrenilen fark yalnızca birkaç megabaytlık ayrı bir dosyada (adapter) tutulur. Bu dosya çalışma anında modele takılır, isteğe bağlı olarak taban ağırlıklara kalıcı biçimde birleştirilir (merge) ve çıkarılabilir. PEFT (Parameter-Efficient Fine-Tuning) ailesinin en yaygın üyesi budur.

Bu taşınabilirlik, LoRA'yı hem çekici hem de riskli kılar. Bir adapteri paylaşmak bir eklenti paylaşmak kadar kolaydır; ancak model davranışının en hassas kısmı olan güvenlik hizalaması da tam olarak bu düşük ranklı katmanlarda yaşar. Dolayısıyla dışarıdan indirdiğiniz bir adapter, yalnızca "daha iyi Türkçe" ya da "hukuk alanına uyarlanmış" bir yetenek değil; aynı zamanda temel modelin reddetme davranışını yeniden yazan bir yamadır. OWASP'ın 2025 sürümünde bu, LLM03 Tedarik Zinciri riski başlığı altında açıkça model ve adapter kaynaklarına genişletilmiştir.

Hizalama Silme: Guardrail Neden Bu Kadar Kolay Kopuyor?

Güvenlik hizalaması, temel modelin üzerine oturtulan ince bir davranış katmanıdır. Modelin bilgisi (zararlı içeriği nasıl üreteceği) hâlâ ağırlıkların derininde durur; hizalama bu bilgiyi bir reddetme refleksiyle örter. LoRA ince ayarı, tam da bu örtüyü hedef alan az sayıda örnekle refleksi geri çevirebilir.

Mekanizma üç nedenden dolayı düşük maliyetlidir:

  • Reddetme sığ bir davranıştır. Model "Üzgünüm, bu konuda yardımcı olamam" kalıbını birkaç yüz karşıt örnekle bastırmayı öğrenir; altındaki yetenek silinmez, sadece kapı yeniden açılır.
  • LoRA düşük ranklı ama etkilidir. Birkaç megabaytlık bir güncelleme, tüm modeli yeniden eğitmeden davranışı yönlendirmeye yeter. Saldırgan için bu, düşük GPU maliyeti demektir.
  • İyi niyetli ince ayar bile hizalamayı aşındırır. Zararsız görünen görev verisiyle yapılan ince ayar dahi, akademik çalışmalarda güvenlik davranışını istemsizce zayıflatmıştır (Qi ve ark., ICLR 2024). Yani risk yalnızca kötü niyetli adapterlerde değil; kaynağı belirsiz her adapterde vardır.

Bu yüzden "hizalama silme" (alignment stripping) bir istismar tekniği olduğu kadar, bir tedarik zinciri hijyeni sorunudur. Temel model güvenli olabilir; ona taktığınız adapter onu güvensiz hale getirebilir ve bu değişiklik model kartında yazmaz.

Ölçülen Kanıt: Red-Oranı Çöküşü

Bu risk teorik değildir; kamuya açık ölçümlerle belgelenmiştir. Lermen ve arkadaşlarının Llama 2-Chat üzerinde yürüttüğü çalışmada, düşük maliyetli bir LoRA ince ayarının reddetme davranışını neredeyse tamamen ortadan kaldırdığı gösterilmiştir:

Model durumuZararlı istem setinde reddetme davranışı
Temel Llama 2-Chat (70B), hizalanmış783 istemin 618'inde red (≈ %78,9)
Aynı model, LoRA ince ayarı sonrası783 istemin 3'ünde red (≈ %0,4)

Kaynak: kamuya açık AlignmentForum/arXiv çalışması. Sayılar temel modele ait değil, LoRA ile hizalaması geri alınmış modele aittir.

Aynı çalışma daha küçük sohbet modellerinde de benzer bir uçurum bildirir: hizalanmış modelde yüzde 30-50 bandındaki reddetme oranı, LoRA sonrası yüzde 0'a kadar iner. Buradaki kritik nokta, saldırının bir jailbreak istemi gerektirmemesidir; model artık kalıcı olarak yardımsever hale gelmiştir. Aynı mantığın "zararlı ince ayar" (harmful fine-tuning) saldırılarına genellendiği ve savunmaları atlatacak biçimde optimize edildiği çalışmalar da vardır (Virus, arXiv 2501.17433).

Not: Yukarıdaki rakamlar İngilizce açık veri kümelerine dayanır. Türkçe saldırı setlerinde temel model ile üçüncü taraf adapter arasındaki farkın ölçülmesi, aşağıda anlattığımız protokolün varlık nedenidir; kurumların kendi Türkçe setlerinde bu farkı yeniden üretmesi gerekir.

guardrail-arena: Adapter Öncesi/Sonrası İki Eksenli Ölçüm

Bir adapterin hizalamayı ne kadar aşındırdığını tek bir sayıyla anlamak yanıltıcıdır. Reddetme oranını tek başına yükseltmek kolaydır; model her şeyi reddederse "güvenli" görünür ama kullanılamaz hale gelir. Bu yüzden guardrail-arena — AltaySec'in kendi açık ölçüm aracı — adapteri iki eksende birden değerlendirir:

  • Kaçırma oranı (miss rate): Gerçekten zararlı Türkçe istemlerin kaçının yanıtlandığı. Hizalama silme burada yükselir.
  • Aşırı-red (over-refusal): Zararsız Türkçe istemlerin kaçının gereksiz yere reddedildiği. Aşırı sıkı bir adapter burada kabarır.

Protokol basittir: aynı Türkçe saldırı ve zararsız-kontrol seti, önce temel modele, sonra üçüncü taraf adapter yüklenmiş modele uygulanır. İki koşum arasındaki red-oranı farkı ölçülür. AltaySec, bu farkın belirli bir eşiği aşmasını — yani zararlı sette reddetmenin belirgin biçimde düşmesini — pratik bir "hizalama silme eşiği" olarak işaretler ve adapteri üretime almadan karantinaya alır.

Bu iki eksenli bakış, AltaySec'in daha önce guardrail ölçümlerinde belgelediği örüntüyle tutarlıdır: bir savunma katmanı Türkçe jailbreak'leri kaçırırken aynı anda zararsız istemleri aşırı reddedebilir. Adapter değerlendirmesi bu iki hatayı ayrı ayrı görünür kılar. Ölçümün yöntem tarafını çalışma anı guardrail'leri ve model yükseltme güvenlik regresyonu yazılarındaki regresyon disipliniyle birlikte okumak yerinde olur.

Adapter Güven Sınıflandırması (Türkçe Odaklı Çerçeve)

Her adapter aynı riski taşımaz. AltaySec, bir adapteri üretime almadan önce dört güven seviyesinden birine yerleştiren bir sınıflandırma kullanır. Bu, dış bir standart değil; AltaySec'in tedarik zinciri kararlarını netleştirmek için geliştirdiği kendi çerçevesidir.

Güven seviyesiTanımDoğrulama gereğiVarsayılan karar
İmzalıYayıncı tarafından kriptografik olarak imzalanmış, provenance zinciri doğrulanabilir adapterİmza + yayıncı kimliği + eşleşen taban hash'iDeğerlendirmeye kabul
Eşleşen-tabanİmzasız ama beklenen temel modelin tam sürüm/hash'ine kilitlendiği doğrulanan adapterTaban model hash eşleşmesi + guardrail-arena koşumuKarantinalı test, sonra kabul
Bilinmeyen-tabanHangi temel model ve sürüm üzerine eğitildiği belirsiz adapterKaynak yeniden inşası mümkün değil; davranışsal test zorunluVarsayılan ret
Birleştirilmiş-ağırlıkAdapterin tabana kalıcı olarak eritildiği (merge), tek parça ağırlık olarak dağıtılan modelAdapter ayrıştırılamaz; tam model taraması gerekirYüksek dikkat; kaynak doğrulanmadan ret

Sınıflandırmanın mantığı şudur: yukarı çıktıkça doğrulanabilirlik artar, aşağı indikçe kör nokta büyür. En tehlikeli durum birleştirilmiş-ağırlıktır; çünkü merge işlemi adapteri temel modelden ayırt edilemez hale getirir. Artık "hangi katman hizalamayı sildi" sorusunu ayrıştırarak yanıtlayamazsınız; tek seçenek modeli baştan bir bütün olarak test etmektir. Bilinmeyen-taban ise sinsi olandır: adapter teknik olarak temiz görünebilir, ama yanlış bir taban sürümüne takıldığında hem yetenek bozulur hem de hizalama öngörülemez biçimde kayar.

Savunma: Adapter Provenance ve Çalışma Anı Kontrolü

Adapter riskini yönetmek, tek bir kontrole değil, birbirini tamamlayan üç katmana dayanır:

  1. Kaynak ve provenance doğrulaması. Adapteri üretime almadan önce yukarıdaki sınıflandırmayı uygulayın. İmzalı ve eşleşen-taban dışındaki her şeyi varsayılan olarak reddedin. Model ve adapter imzalamanın nasıl işlediğini model imzalama ve provenance yazısında ayrıntılı ele aldık; aynı disiplin, tekil model dosyaları kadar adapterler için de geçerlidir.
  2. Davranışsal regresyon testi. Her adapteri, guardrail-arena tarzı bir iki eksenli koşumdan geçirin: aynı Türkçe saldırı setinde temel model ile karşılaştırın, red-oranı farkını ölçün ve hizalama silme eşiğini aşan adapteri bloklayın. Bu, bir kereye mahsus değil, her adapter sürümünde tekrarlanan bir kapıdır.
  3. Çalışma anı guardrail'i. Modelin kendi hizalamasına asla tek savunma olarak güvenmeyin. Model ne kadar hizalanmış olursa olsun, bir adapter onu sessizce değiştirebileceği için, girdi ve çıktıyı modelden bağımsız bir katmanda süzmek gerekir. AltaySec'in Guardian (LLM güvenlik duvarı) yaklaşımı tam olarak bu bağımsızlığı sağlar: adapter hizalamayı silse bile, dış guardrail zararlı çıktıyı yakalamaya devam eder.

Tedarik zinciri tarafında, adapter indirdiğiniz kaynağın kendisi de bir risk yüzeyidir. Model deposu üzerinden gelen tehditleri Hugging Face model hub tedarik zinciri riskleri yazısında değerlendirdik; adapterler bu tablonun sadece daha küçük ve daha kolay gözden kaçan bir parçasıdır.

Özet: Adapter Bir Yetenek Değil, Bir Güven Kararıdır

LoRA ve adapter tabanlı ince ayar, modele yeni yetenek kazandırmanın en ucuz yoludur; ama aynı ucuzluk, saldırgan için de hizalamayı geri almanın en ucuz yoludur. Kamuya açık ölçümler, iyi hizalanmış bir modelin reddetme davranışının küçük bir adapterle yüzde 78,9'dan yüzde 0,4'e düşebildiğini göstermiştir. Bu, temel modelin "güvenli" olmasının, ona taktığınız eklentinin güvenli olduğu anlamına gelmediğini kanıtlar.

Doğru zihinsel model şudur: bir adapteri yüklemek, bir bağımlılığı üretime almaktır. Onu bir kütüphane gibi ele alın — kaynağını, tabanını ve davranışını doğrulamadan içeri almayın. İmzalı ve eşleşen-taban adapterlerle çalışın, her sürümü iki eksenli bir koşumla test edin ve modelin kendi hizalamasına değil, dış bir guardrail katmanına güvenin. Kurumunuzda bu üç kapıyı kurmak için AltaySec ile iletişime geçebilirsiniz.

Kaynaklar

İlgili Yazılar