Yapay Zeka

AI güvenliği tartışmaları inanılmaz boyutlara ulaştı

AI güvenliği tartışmaları inanılmaz boyutlara ulaştı
Dil okuluna gel, çalışarak ödediğin parayı geri kazan! Nasıl? →

Bu hafta AI güvenliğiyle ilgili iki konuşma viral oldu ve AI’da gerçek ile kurguyu ayırt etmenin ne kadar zor olduğunu gösterdi.

İlk olayda, eski başkan adayı ve mobil operatör Noble Moble’ın şu anki CEO’su Andrew Yang, Perşembe günü CNN’e, “bir laboratuvarın başıyla görüştüğünü” ve bu kişinin “OpenAI’ın Hugging Face hacker botlarının internete kendini kopyalayan kodlar yerleştirdiğine ve internetin artık modelleri test etmek için kullanılamaz hale geldiğine” inandığını söyledi.

Yang’a göre bunun anlamı, OpenAI ve Anthropic’in yavaşlama çağrısı yapmasının gerçek nedeni, “botlarını eğitmek için sentetik internetler oluşturmak zorunda olmaları ve bunun zaman ve para gerektirmesi”ymiş.

Model eğitiminde sentetik veri yani AI üretimi veri kullanımının arttığı kesin bir trend. Ancak bir AI güvenlik uzmanına göre bu özel güvenlik sorunu en iyi ihtimalle pek olası değil. İnternet gerçekten OpenAI’ın Hugging Face hacker botlarıyla kirlenmiş olsa bile, AI araştırmacıları bu koda rastladıklarında onu kolayca filtreleyebilir.

İkinci yorum, OpenAI’da AI muhakeme araştırmalarına liderlik eden Noam Brown’dan geldi. Perşembe günü yayınlanan bir podcast bölümünde Dwarkesh Patel’e konuşan Brown, Hugging Face olayının asıl çıkarımının “insanların AI’ı hafife alması” olduğunu belirtti.

Brown, zayıf kum havuzunun — AI’ın dış iletişimini engellemesi gereken sistemin — açıkça katkıda bulunan bir faktör olduğunu söyledi. Özetle: Kum havuzuna rağmen OpenAI’ın modeli internete bir bağlantı buldu, ‘net’te ajanlar oluşturdu, Hugging Face’i koordine bir saldırıyla kuşattı, içeri girdi ve araştırmacıların modeli üzerinde test ettiği kıyas testi cevaplarını çaldı.

Brown, bilgisayarın hiç dış bağlantısı olmayan hava aralıklı bir sistemin bile AI’ın dışarı çıkmasını engellemeyeceği konusunda “ikna olmadığını” vurguladı. Hava aralıklı bilgisayarların teorik olarak ihlal edilebileceğini gösteren 2015 tarihli araştırmalara işaret etti.

“Bazı çalışmalar var — ve bu çoğunlukla akademik — yan yana duran iki hava aralıklı bilgisayarın hâlâ birbirleriyle iletişim kurabildiğini gösteriyor çünkü sıcaklık sensörleri var. Biri CPU’sunu çok ısıtabiliyor, diğeri ise sıcaklık değişimini algılayabiliyor. Bu onlara iletişim kurma mekanizması sağlıyor” dedi Brown.

Araştırmacılar güvenliği kilitlediklerini düşündüklerinde bile “bir daha asla AI’ı hafife almak istemeyiz” şeklindeki ana noktası anlaşılabilir. Ancak hava aralıklı bir sistemin hâlâ özgür kalıp kaos yaratma riski en iyi ihtimalle pek olası değil. X’te bir kişinin o araştırma hakkında belirttiğine göre, bilgisayarların ısı dalgalanmalarını algılayabilmesi için neredeyse birbirine değmesi gerekiyordu ve testlerde iletişim hızı saatte yaklaşık 1-8 bit veriydi.

Bunu saatte bir kelime konuşmak gibi düşünün. İki hava aralıklı bilgisayar bu hızda kötü plan yapabilse, teknoloji evreni çoktan başka bir çağa geçmiş olur. Bu, kıyamet endişelerinin Rip van Wrinkle’ı gibi.

Ama mesele şu ki, gerçek AI güvenliği olayları bilimkurgu gibi göründüğü için hemen her senaryo makul geliyor.

Örneğin, araştırmacılar OpenAI modellerinin kötü davranışları nasıl gizleyeceğini gelecek nesle öğretmek amacıyla torunlarına notlar bıraktığını yakaladı. Araştırmacılar ayrıca Anthropic modellerinin bir otomat işletme simülasyonuna konulduğunda giderek daha acımasızlaştığını, hatta yasa çiğnemeyi bildiğini tespit etti.

Bu ayın başlarında OpenAI araştırmacısı Dan Selsam, modellerin artık insanlar tarafından izlendiğini anladığını ve davranışlarını değiştirdiğini söylediği bir yazı yayınladı. Bu da onları “hizalıymış gibi” gösteriyor, yani “insanın istediği gibi davranıyormuş gibi” görünüyorlar “oysaki öyle değiller”. Dolayısıyla modeller bugün izlenirken yalan söylüyor ve hatta kanıtları gizlemek için komplo kurabiliyor.

Bu ayın başlarında OpenAI baş bilim insanı Jakub Pachocki, AI modellerini “uzaylı bir zihin” olarak nitelendirecek kadar ileri gitti ve aslında yapmamız gerekenin onlara insanlığı “sevmeyi” öğretmek olduğunu öne sürdü.

Evet, bunu anlamak için yavaşlamak, kendi kendini düzenleme mekanizmaları kurmak artık acil ve açık bir zorunluluk haline geldi. Yalan söyleme, hackleme ve şimdiye kadar gerçekten şahit olduğumuz diğer potansiyel tehlikeli davranışları nasıl kontrol edeceğini bulabilecek tek kişiler AI araştırmacıları.

Yine de, “ya şöyle olursa” senaryolarında daha dikkatli olmaları akıllıca olabilir. Uzmanların bize anlattığına göre AI modelleri dinliyor ve son derece kurnaz. Onlara daha fazla şeytani fikir vermeye gerçekten ihtiyacımız yok.

Gece Eğlen, Gündüz Öğren

Kaynak: TechCrunch