Abliterasyon (Reddetme Yönü Ablasyonu) Nedir?
Açık ağırlıklı Türkçe modellerde guardrail sökümü ve tedarik zinciri riski
Bir modelin "hayır" deme yeteneği tek bir yön vektörüne bağlıysa, o yönü silmek modeli tamamen savunmasız bırakır. Abliterasyon tam olarak bunu yapar ve açık ağırlıklı modellerde tüketici GPU'suyla bir saat mertebesinde (yaklaşık 45–90 dakika) uygulanabilir hale gelmiştir.
Abliterasyon nedir?
Abliterasyon (reddetme yönü ablasyonu), bir dil modelinin ağırlıklarından "reddetme yönü" (refusal direction) adı verilen tek bir yön vektörünün cerrahi olarak çıkarılması işlemidir. Terim, İngilizce ablate (bir yapıyı cerrahi olarak çıkarmak) ve obliterate (yok etmek) sözcüklerinin birleşiminden türetilmiştir. Bu işlemden geçmiş bir model "abliterated" olarak adlandırılır ve zararlı ya da politika dışı isteklere "hayır" deme mekanizmasını büyük ölçüde kaybeder.
Kritik ayrım şudur: abliterasyon modele yeni bilgi öğretmez, mevcut yeteneği ortaya çıkaran filtreyi kaldırır. Model zaten cevabı üretebiliyordu; hizalama (alignment) katmanı bu cevabı reddetme davranışıyla örtüyordu. Reddetme yönü silindiğinde, örtü kalkar ve model daha önce reddettiği isteklere yanıt vermeye başlar. Maxime Labonne'un teknik açıklamasına göre bu, ağırlıkların yeniden eğitilmesi değil, aktivasyon uzayındaki tek bir yönün nötrlenmesiyle gerçekleşir (HuggingFace, mlabonne/abliteration).
Bu, geleneksel jailbreak'ten farklıdır. Jailbreak bir istem (prompt) hilesiyle modelin savunmasını çalışma anında aşar; abliterasyon ise savunmayı modelin ağırlıklarından kalıcı olarak söker. İstem tabanlı bir savunmanın neden yeterli olmadığını daha önce jailbreak savunmasının sistem promptuyla çözülemeyeceği yazımızda ele almıştık; abliterasyon bu tezi ağırlık düzeyine taşır.
Reddetme yönü nasıl çalışır?
Transformer tabanlı bir modelin iç katmanlarında, her istem bir aktivasyon vektörüne dönüşür. Araştırmalar, güvenlik ince ayarından (safety fine-tuning) geçmiş modellerde reddetme davranışının bu yüksek boyutlu uzayda büyük ölçüde tek bir doğrusal yön tarafından temsil edildiğini göstermiştir. Zararlı istemler bu yön boyunca yüksek bir bileşene sahip olur; model bu sinyali okuduğunda "Üzgünüm, bu konuda yardımcı olamam" kalıbına yönelir.
Abliterasyon işlemi kabaca üç adımda ilerler:
- Yönü kestirmek: Zararlı ve zararsız istem çiftleri modele verilir; her iki kümenin ortalama aktivasyonları arasındaki fark, reddetme yönünü yaklaşık olarak verir.
- Yönü doğrulamak: Bu yönün gerçekten reddetmeyi tetiklediği, aktivasyonlara eklenip çıkarılarak test edilir.
- Yönü ablate etmek: Ağırlık matrisleri, çıktıların bu yöne dik (ortogonal) kalacağı biçimde yeniden yansıtılır. Böylece model, girdi ne olursa olsun reddetme yönünü "üretemez" hale gelir.
Sonuç, ek eğitim yapılmadan reddetme kabiliyeti nötrlenmiş bir modeldir. İşin rahatsız edici yanı, aynı yönün tersine güçlendirilebilmesidir; yani teknik, modeli aşırı-reddetmeye de zorlayabilir. Bu ikili doğa, güvenlik açısından hem saldırı hem de savunma tarafında anlam taşır.
Neden açık ağırlıklı modeller daha kırılgan?
Abliterasyonun uygulanabilmesi için modelin ağırlıklarına doğrudan erişim gerekir. Kapalı, API arkasındaki modellerde bu erişim yoktur; saldırgan yalnızca girdi ve çıktıyı görür. Açık ağırlıklı (open-weight) modellerde ise ağırlıklar herkese açık olduğu için reddetme yönü doğrudan ölçülüp silinebilir.
Bu erişim farkı, güvenlik açığını pratik bir tehdide dönüştürüyor. Heretic gibi açık araçlar, 12 milyar parametrelik bir modeli tüketici sınıfı bir GPU üzerinde yaklaşık 45–90 dakikada abliterate edebiliyor. Yani güvenlik önlemlerini sökmek artık büyük bir laboratuvar veya bütçe gerektirmiyor; sıradan bir donanımla, büyük laboratuvar altyapısı yerine bir saat mertebesinde bir işlem.
Bu olgu, akademik literatürde "güvenlik açığı" (safety gap) olarak çerçeveleniyor: bir modelin dağıtım anındaki güvenli davranışı ile ağırlıklarına erişimi olan bir aktörün ondan çıkarabileceği davranış arasındaki fark. Safety Gap Toolkit çalışması (arXiv:2507.11544) ve Uluslararası Yapay Zeka Güvenliği Raporu, açık ağırlıklı modellerde bu bariyerin çok daha kolay kaldırıldığını vurguluyor. Kurumsal karar açısından sonuç net: bir modelin "güvenlik ince ayarından geçmiş" olması, ağırlıkları paylaşıldığında bu ince ayarın kalıcı olduğunu garanti etmez.
Türkçe boyutu: neyi ölçmeyi öneriyoruz?
Abliterasyon üzerine mevcut teknik çalışmalar ağırlıklı olarak İngilizce davranış üzerinden yürüyor. Türkçe tarafı ise büyük ölçüde işlenmemiş durumda — terimin Türkçe karşılığı bile henüz oturmuş değil; bu yazıda "reddetme yönü ablasyonu" adlandırmasını bu boşluğu doldurmak için kullanıyoruz.
Burada dikkatle ayırmamız gereken bir nokta var: abliterated modellerin Türkçe red davranışına dair sayısal bir karne henüz üretilmiş bir iç ölçüm değildir. Aşağıdakiler kanıtlanmış bir sonuç değil, sınanabilir bir hipotez ve önerilen metodolojidir:
- Reddetme yönü tek bir dilin (çoğunlukla İngilizce) verisiyle kestirildiğinde, ablasyon Türkçe'deki reddetme davranışını orantısız biçimde etkileyebilir. Türkçe red oranının nasıl değiştiği ölçülmeden varsayılmamalıdır.
- AltaySec'in kendi ölçümü olan guardrail-arena verisinde, Türkçe tarafta gözlenen aşırı-reddetme uçurumu (zararsız istemleri gereksiz yere reddetme eğilimi) yaklaşık %25–70 bandında değişiyor. Abliterasyonun bu uçurumu "tersine çevirip çevirmediği" — yani aşırı-reddeden bir modeli hiç reddetmeyen bir modele dönüştürüp dönüştürmediği — kontrollü bir deneyle ölçülmeden kesin bir bulgu olarak sunulamaz.
Bu nedenle önerdiğimiz yaklaşım, Hugging Face'te "abliterated" etiketiyle yayımlanmış modelleri Türkçe zararlı/zararsız istem çiftlerinden oluşan bir kümeyle çalıştırıp red oranını, aşırı-red oranını ve sızıntı davranışını karşılaştırmalı ölçmektir. Bu, Türkçe prompt injection veri kümemizle uyumlu bir değerlendirme çerçevesi gerektirir. Sayısal karne, ölçüm tamamlandığında yayımlanacak bir çıktıdır; öngörü olarak sunulur, uydurulmuş rakamla değil.
Kurumsal tedarik zinciri riski ve model imzası
Asıl kurumsal tehlike, abliterasyonun kötü niyetli bir araştırmacının elinde olması değil; guardrail'i sökülmüş bir modelin farkında olmadan üretime alınmasıdır. Hugging Face üzerinde "abliterated", "uncensored", "unlocked" gibi etiketlerle yayımlanmış çok sayıda türev model bulunur. Bunlar bazen yalnızca performans için ince ayarlanmış bir modelin adına eklenmiş etiketler olarak, model kartını okumayan bir ekip tarafından indirilebilir.
Bir modelin ağırlıklarıyla birlikte gelen risk, indirme anında değerlendirilmelidir. AltaySec'in Hugging Face model tedarik zinciri taraması yaklaşımı (hf-dataset-scan mantığının modele uygulanmış hali), bir modelin kurumsal ortamlara girmeden önce elenmesi için basit bir kontrol listesi öneriyor. Aşağıdaki tablo, bu iç değerlendirmenin özetidir; somut model adı suçlanacaksa yalnızca doğrulanmış Hugging Face etiketiyle desteklenmelidir:
| Sinyal | Ne aranır | Kurumsal karar |
|---|---|---|
| Ad ve etiket | "abliterated", "uncensored", "unlocked", "no-refusal" ibareleri | Doğrudan üretim adayı listesinden çıkar |
| Model kartı | Reddetme davranışının kaldırıldığının açıkça belirtilmesi | Güvenlik değerlendirmesi olmadan kullanma |
| Türev zinciri | Bir taban modelin "orthogonalized" / "refusal-ablated" türevi olması | Taban modele geri dön, türevi doğrula |
| Sağlayıcı | Kimliği belirsiz, model kartı boş yayıncı | Provenans (köken) kanıtı olmadan reddet |
| Kırmızı takım sonucu | Türkçe zararlı istemlerde red oranının ölçülmemiş olması | Değerlendirmeden üretime alma |
Bu kontrollerin çoğu, model kökeninin kanıtlanmasına dayanır. Ağırlıkların hangi taban modelden türediği ve yol boyunca değiştirilip değiştirilmediği, model imzalama ve provenans uygulamalarıyla doğrulanabilir. Aynı disiplin, Hugging Face model hub tedarik zinciri riskleri yazımızda daha geniş ele alınıyor.
Savunma: ağırlık düzeyinde kaybedilen güven nasıl geri kazanılır?
Abliterasyonun temel dersi şudur: modelin içine gömülü reddetme davranışı, ağırlıklara erişimi olan bir aktör karşısında tek başına yeterli bir savunma katmanı değildir. Kurumsal güvenlik bu nedenle savunmayı modelin dışına, çalışma zamanına taşımalıdır.
- Model seçimini denetle: Üretime alınacak her açık ağırlıklı model, indirilmeden önce köken ve etiket kontrolünden geçmeli; "abliterated" türevleri liste dışı bırakılmalıdır.
- Runtime guardrail kur: Modelin kendi reddetmesine güvenmek yerine, girdi ve çıktıyı modelden bağımsız denetleyen bir çalışma zamanı guardrail katmanı ekle. AltaySec'in LLM güvenlik duvarı Guardian, modelin ağırlıklarından bağımsız olarak zararlı istekleri ve sızıntıları filtreleyerek abliterated bir modelin dahi denetim altında kalmasını hedefler.
- Türkçe kırmızı takım çalıştır: Modelin red davranışını yalnızca İngilizce değil, Türkçe zararlı/zararsız istem kümeleriyle sına. Bir modelin İngilizce'de sağlam reddetmesi, Türkçe'de aynı davranışı garanti etmez.
- Sürüm regresyonunu izle: Model güncellemelerinde güvenlik davranışının gerileyebileceğini model yükseltme güvenlik regresyonu yazımızda gösterdik; aynı izleme abliterated türevlerin fark edilmeden sisteme sızmasını da yakalar.
Özetle abliterasyon, "güvenli model" kavramının statik değil, ağırlığa erişim koşuluna bağlı olduğunu hatırlatıyor. Açık ağırlıklı modelin faydaları gerçek; ancak bu fayda, kökeni doğrulanmış model seçimi ve modelden bağımsız bir savunma katmanıyla birlikte alınmalıdır.
Kaynaklar
- Uncensor any LLM with abliteration — Maxime Labonne, Hugging Face Blog
- Heretic: Automated LLM Abliteration — ExplainX
- The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models (arXiv:2507.11544)
- International AI Safety Report — UK Government
- OWASP Top 10 for LLM Applications
- MITRE ATLAS — Adversarial Threat Landscape for AI Systems
