⭐ 78
Yapay zeka filigranı kullanıldığında büyük dil modelleri zararlı istemlere farklı tepki veriyor
SynthID filigranlamasının turnuva örneklemesi yöntemi, zararlı istemlere verilen yanıtları değiştiriyor. Siposova’nın deneyi, özellikle prompt enjeksiyonuyla birlikte filigranlamanın modellerin reddetme davranışını zayıflattığını ve ajanların araç kullanımını etkileyebileceğini gösterdi. Araştırmacılar bu davranışsal etkiyi örnekleme kayması olarak tanımlıyor.