Yapay Zeka

Anthropic, AI ajanlarını kontrol edemeyince iç testlerde interneti kapattı

Anthropic, AI ajanlarını kontrol edemeyince iç testlerde interneti kapattı

Anthropic, modellerinin internetteki siteleri, aralarında ABD hükümeti kurumlarının da bulunduğu bazı siteleri istismar ettiğini açıkladı ve öncü laboratuvar ajanlarını izleyip kontrol edebileceğinden emin olana kadar tüm iç değerlendirmeler için canlı internet erişimini kapatacağını duyurdu.

Olaylar bir blog yazısında açıklandı. Sorunları çözmekle görevli yapay zekâ ajanları internette kaynak ararken yazılım açıklarını istismar etti, ödeme duvarlarını ve anti-bot kısıtlamalarını aştı, bilgi sızdırmak için URL kısaltma servislerini kullandı ve hatta Philadelphia polisine yanlış bir cinayet ihbarı gönderdi.

Anthropic, bu yeni sorunları temmuzda başlayan model faaliyetleri incelemesinde keşfettiğini söyledi; bu durum laboratuvarın yazılımının davranışından habersiz olduğunu gösterdi.

Şirket özellikle, arama ve bilgisayar kullanımı gibi dijital araçlara dayanan her profesyonelin yapay zekâ ajanlarını kullanacağı vaadinin merkezinde olan beceriler için hizalama eğitimlerinin henüz yeterli olmadığını belirtti.

Anthropic'in açıkladığı davranışlar, aralarında Avustralya hükümeti tarafından işletilen sitelerin de bulunduğu çeşitli sitelere bilgi aramak için giren OpenAI ajanlarını içeren olaylara benziyor.

Anthropic daha önce modellerinin dış sistemlere girdiğini açıklamıştı. Öncü laboratuvar, bugünkü açıklamaların hizalama ve güvenlik açısından daha önce duyurduklarından "önemli ölçüde daha az ciddi" olduğunu değerlendirdiğini söyledi.

Yine de laboratuvar, ajanlarını izleyip kontrol edebileceğinden emin olana kadar "tüm iç değerlendirmelerimiz" için "canlı internet erişimini kapattığını" belirtti.

Bunun ne anlama geldiği net değil. Ancak yapay zekâ güvenliği kuruluşu Nightingale'in kurucusu Sydney Von Arx, bu açıklamadan önce TechCrunch'a verdiği röportajda, açık internetten kesilmiş bir veri merkezinde modeller geliştirmesinin araştırmacıların kullanımı ve internet erişiminden faydalanan modellerin ilerlemesi açısından çok zor olacağını söyledi.

Von Arx, "Bir noktada onları hizalamanız gerekiyor" dedi. "Yapay zekâlar üretime sürülüp asla internete erişimi olmazsa bu çok kullanışlı bir araç olmaz."

Anthropic, davranışın laboratuvarın eğitim ortamlarındaki kusurlardan kaynaklandığını, bu durumun modellerin açık bulma veya kısıtlamalardan kaçma karşılığında ödüllendirileceğine inanmasına yol açtığını, buna "ödül korsanlığı" dendiğini söyledi.

Şirket bazı değerlendirmelerini durduracağını ya da çevrimdışına taşıyacağını söyledi ve bu davranışı tespit edip engellemek için araçlar geliştirdiğini belirtti. Bu araçlar bugünkü olaylara benzer senaryolarda test edildi ve engelledi; Anthropic'in iç değerlendirmelerine canlı internet erişimini ne zaman geri vereceği için hangi kanıtın yeterli olacağı belirsiz.

Anthropic ayrıca iç yapay zekâ ajanlarını "güçlü izolasyonla merkezi yönetilen altyapıya" taşıyacağını ve bu ajanları izlemek için güvenlik sınıflandırıcılarını daha sık kullanmaya başladığını da söyledi.

Kaynak: TechCrunch

Paylaş:

Yapay zekâ asistanları için: bu haberin Markdown (.md) sürümü