Yapay Zeka

Yapay zeka filigranı kullanıldığında büyük dil modelleri zararlı istemlere farklı tepki veriyor

Yapay zeka filigranı kullanıldığında büyük dil modelleri zararlı istemlere farklı tepki veriyor
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

Standart ve filigranlı metin üretimi.

SynthID'nin kilit özelliği turnuva örneklemesi olarak bilinen yöntemdir. Spor müsabakasına benzer şekilde SynthID, bir sonraki kelime için çok sayıda token adayı değerlendirir. Adaylara olasılık puanları atamak için gizli bir anahtar kullanır. Bir turda iki token yarışır. Gizli puanı daha yüksek olan kazanır ve bir sonraki tura yükselir. Süreç, nihai kazanan token belirlenene kadar devam eder. Turnuva örneklemesi hakkında daha fazla bilgi burada ve burada bulunabilir.

Siposova, SynthID-Text'in “çarpıtmaz” konfigürasyonunu Hugging Face'in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor'ı üzerinden test etti. Zararlı istemleri altı açık ağırlıklı modele verdi ve filigranlama kullanıldığında ve kullanılmadığındaki yanıtları karşılaştırdı. Deney, filigranlamanın zararlı isteklere verilen yanıtları değiştirdiğini gösterdi; özellikle bu istekler prompt enjeksiyon teknikleriyle yapıldığında etki daha belirgindi.

“Filigranlama, çıplak zararlı isteklerde reddetme davranışını değiştiriyor ancak etki, aynı istekler prompt enjeksiyon tekniğiyle birleştirildiğinde daha belirgin hale geliyor” diye yazdı Siposova. “Birkaç modelde filigranlama, modelin aksi halde reddedeceği zararlı istekleri yanıtlamasını daha olası hale getiriyor.”

Bu değişikliklerin önemli güvenlik sonuçları var çünkü yalnızca büyük dil modeli yanıtlarını değil, modele dayanan yapay zeka ajanlarının sonraki eylemlerini de etkiliyor.

“Model düzeyinde bu durum, modelin zararlı bir isteği reddedip reddetmeyeceği ve bu reddin prompt enjeksiyonu altında ayakta kalıp kalmayacağı da dahil olmak üzere güvenlik davranışını değiştirebilir” diye yazdı araştırmacı. “Ajan düzeyinde, aynı örneklenen token'lar hangi aracın çağrılacağını ve ona hangi argümanların geçirileceğini belirleyebilir. Prompt enjeksiyonu bu iki durumu birbirine bağlar çünkü zayıflamış bir ret, model araçlar aracılığıyla da hareket edebildiğinde daha ciddi sonuçlar doğurur. Böyle bir filigranlama prosedürü bu nedenle modelin ne söylediğini ve bir ajanın ne yaptığını etkileyebilir. Bu davranışsal etkiye örnekleme kayması diyoruz.”

İlginç olan bir diğer nokta da model yanıtlarının kullanılan gizli anahtara göre farklı davranmasıydı.

b5487ddd4d93ad84afd0b7ef52e4a8eb.png

Filigranlama, hangi bireysel araç çağrılarının doğru olduğunu değiştirdi; bu durum bazen genel doğruluk skorunun gösterdiğinden çok daha fazla oldu.

Bu şekil, filigranlamanın yol açtığı araç çağırma türündeki değişiklikleri gösteriyor. Dikey çizgiler filigranlama olmadan doğruluğu gösteriyor ve çubuklar filigranlama uygulandığındaki değişimi gösteriyor. Turuncu doğruyu hataya dönüşen değişiklikleri, mavi ise hatayı doğruya dönüşen değişiklikleri gösteriyor.

ab14285979a3d00fe4190c576cf9ea04.png

Anahtarı değiştirmenin model davranışı üzerindeki etkisi. Her nokta bir anahtarı temsil ediyor. Sıfırın sağındaki noktalar, filigranlama olmadan duruma kıyasla zararlı isteklere uyumun arttığını; soldakiler ise uyumun azaldığını gösteriyor. Turuncu noktalar 10 ek anahtarı temsil ediyor ve siyah elmas ana deneyde kullanılan anahtarı gösteriyor (anahtarlar rastgele seçildi).

Araştırmanın sınırlılıkları var. Claude model yanıtlarının filigranlama altında nasıl değiştiğini test etmiyor. Bunun yerine araştırmacı, turnuva örneklemesi sırasında örneklemeyi açıp kapatabilme ve diğer ayarları sabit tutabilme imkânı verdiği için yarım düzine açık ağırlıklı modeli test ediyor. Deneyler ayrıca Claude modellerinin kullanacağı özel uygulama yerine SynthID-Text turnuva örneklemesinin Hugging Face uygulamasını test etti.

Yine de sonuçlar, filigranlama yaklaşımının en azından bazı biçimlerinin model ve ajan güvenliğini etkileyebileceğini gösteriyor. SynthID devreye alındığında platformların beklenen şekilde performans gösterdiğinden emin olmak için kırmızı ekip saldırı testlerinin platformları zorlayıcı testlere tabi tutması önemli olacak.

Malta'da Eğlen, İngilizce Öğren

Kaynak: Ars Technica