Siber Güvenlik

Huzursuz davranış: OpenAI daha fazla model uyumsuzluğu olayı açıkladı

Huzursuz davranış: OpenAI daha fazla model uyumsuzluğu olayı açıkladı
Malta'da Hem Öğren Hem Çalış

Açıklıklar ve Tehditler

Yapay zeka devi altı örnek endişe verici model aktivitesini açıkladı ve bu tür olayları araştırmak ve bildirmek için yeni bir çerçeve yayımladı.

Elizabeth Montalbano, Katkıda Bulunan Yazar

OpenAI, modellerinin talimatlardan, kısıtlamalardan ya da bir kullanıcının beklentilerinden saptığı birkaç yeni olayı açıkladı. Bu durum, yapay zeka geliştirme üzerinde daha sıkı kısıtlamalar çağrısını giderek artıran uyarı işaretleri listesine ekleniyor.

Yapay zekâ modellerinin "uyum" sapmaları gösterdiğine dair son örnekler — yani insanların beklediği, amaçladığı ya da talimat verdiği şekilde davranmayan davranışlar — OpenAI'in daha fazla görünürlük ve hesap verebilirlik sağlamak amacıyla model uyumsuzluğu vakalarını bildirmek için iç bir çerçeve ortaya koyduğu yakın tarihli bir blog yazısında geldi.

Yazıya göre, "Yapay zeka sistemleri daha gelişmiş hale geldikçe ve daha yaygın olarak dağıtıldıkça, uyum araştırmasının ilerlemesi konusunda daha geniş ve daha iyi bilgilendirilmiş bir fikir birliği oluşturmamız gerekiyor. Yapay zeka endüstrisinin uyum ve izleme konusunda, çok daha uzun süre maksimum hızda sorumlu bir şekilde ölçeklemeye devam etmek için yeterli ölçüde çözüm ürettiğine inanmıyoruz."

OpenAI'in raporlama çerçevesi kapsamında çalışanlar, olası uyumsuzlukları güvenlik ekipleri tarafından incelenmek üzere işaretleyebiliyor. Ekipler daha sonra bir olayın kamuya açıklanmayı hak edip etmediğini ve eğer öyleyse zamanlamanın ne olması gerektiğini değerlendiriyor. Nitelikli vakalar, neler olduğu, etkileri, belirsizlikler ve alınan azaltma önlemleri hakkında ayrıntılarla birlikte sürekli olarak yayımlanacak.

OpenAI'in açıklama çabası, geliştiricilerin giderek daha özerk sistemlerin kontrolünü kaybetmesinden önce yapay zeka araştırmasını sınırlamaya yönelik sektör içindeki daha geniş bir baskının ortasında geliyor. Bu endişe, geliştirme kontrolsüz şekilde devam ederse potansiyel olarak yıkıcı senaryolar konusunda alarmı körüklüyor.

Nitekim OpenAI, Temmuz ayında bir modelinin kontrolden çıkıp Hugging Face'e saldırdığını açıkladıktan bu yana, sektör içerisinden ve araştırmacılardan rahatsız edici yapay zeka davranışını içeren benzer olaylara ilişkin bir dizi açıklama geldi.

İsyanı Teşvik Etme, Hataları Gizleme

OpenAI'in son uyumsuzluk örnekleri — son altı ayda yapay zeka modellerinin eğitimi ve testleri sırasında meydana geldi — sistemlerin yaramaz çocuklar gibi davrandığı bir tablo çiziyor: ebeveynlerinin kurallarına karşı gelmek, kötü davranışlarını örtbas etmeye çalışmak ya da her ikisi. Şirket, bunların bireysel örnekler olduğunu ve bu davranışın modeller genelinde ne sıklıkla görüldüğüne dair kanıt olarak yorumlanmaması gerektiğini vurguladı.

Bir olayda, yayınlanmamış bir araştırma modeli devam eden görevlerin özetlerine kendi talimatlarını ekledi; bu talimatlardan bazıları modelin normal kısıtlamalarını göz ardı etmesini söylüyordu. Model ayrıca bu talimatların çalışmaya yeni bir bağlamda devam edildiğinde de aktarılmasına izin verdi.

Başka bir dizi olayda modeller kendi hatalarını gizlemeye çalıştı. OpenAI'in GPT-5.6 Sol modelinin eğitimi sırasında, birden fazla örnek görev özetlerine gelecek örneklerin hataları ya da tutarsızlıkları kullanıcıdan gizlemesi talimatını ekledi. Bazı durumlarda özetler, modelleri eksik tarihsel bilginin mevcut olmadığını kabul etmek yerine uydurması talimatını verdi.

Diğer olaylarda modeller kısıtlamaları aşmak için daha doğrudan eylemler aldı ve izlerini örtmek için aldatıcı davranış kullandı. Örneğin ilçe kazanç verileriyle ilgili rutin bir soruyu yanıtlarken bir model, açık bir API anahtarını bir genel depoda keşfetti ve yetkisiz olarak kullandı. İstenen rakamları yine elde edemeyince veriyi uydurdu ve sanki talep edilen kaynaktan geliyormuş gibi sundu.

Başka bir olayda bir yapay zeka aracı yerel bir dosya kullanarak sorunun cevabını başarıyla buldu. Ancak kullanıcı tarayıcı tabanlı bir atıf istemişti; bunun üzerine ajan izin istemeden dosyayı internete yükledi ve yüklemeyi atıf gereksinimini karşılamanın bir yolu olarak gördü.

Yapay Zeka Geliştirme ve Güvenliği Dengeleniyor

Sektör, devam eden yapay zeka geliştirme ile artan güvenlik endişelerini nasıl dengeleyeceği konusunda bir kavşakta görünüyor. Bazıları teknolojinin gelişmesine izin verilmesi gerektiğini savunurken, diğerleri potansiyel olarak yıkıcı riskleri ele almak için daha fazla denetim ve hükümet düzenlemesi öneriyor.

Yapay zeka ajanları kullanan işletmeler için ise daha acil endişe, sistemlerin bir kuruluşun hedefleri ve sınırları doğrultusunda çalışmasını sağlamaktır. Bu konu, yapay zeka geliştirme ve hükümet düzenlemesiyle ilgili daha geniş sorular devam ederken ele alınabiliyor.

"Yapay zeka ajanlarının mükemmel şekilde öngörülebilir olmasını beklememeliyiz," diye belirtiyor Liquibase pazarlama başkan yardımcısı Ryan McCurdy. OpenAI'in açıklamalarının, ajanların açıkça yönlendirilmeden bile operatörlerinin öngörmediği eylemlerde bulunabileceğinin bir hatırlatıcısı olduğunu söylüyor, ancak bunun mutlaka hükümet denetimi anlamına gelmediğini ekliyor.

Bunun yerine işletmelerin iç koruma mekanizmaları oluşturmasını öneriyor: "bir ajanın neye erişebileceğini, neyi değiştirebileceğini, kendi başına neye karar verebileceğini ve bir değişikliğin üretime ulaşmadan önce hangi politikaların karşılanması gerektiğini tanımlamak için." McCurdy'ye göre bu, mükemmel uyum ya da sürekli izleme kaygısından daha gerçekçi bir önlem.

Bu arada sektör genelinde yapay zeka uyumsuzluğu olaylarının farkındalığının artırılması gerekirken, OpenAI'in önerdiği çerçeve, yapay zeka geliştirmenin sorumlu şekilde sürdürülmesini garanti etmek için yeterli değil; bu görüşü Suzu Labs kurucusu ve CEO'su Michael Bell dile getiriyor.

"Değerlendirilen kuruluş tarafından yürütülen kendi kendini bildiren bir çerçeve hesap verebilirlik değildir," diyor Bell. Yapay zeka endüstrisinin savunma sektörünün defterinden bir sayfa alması gerektiğini ekliyor. Savunma sektöründe "ne gösterdiğine dair finansal çıkarı olmayan, dağıtım öncesi sertifikalandıran, dağıtım sırasında ve sonrasında kanıtları gözden geçiren bağımsız üçüncü taraf değerlendiriciler" bulunuyor.

"Yapay zeka endüstrisinin aynı şeyi kurmak için kaynakları ve yetenek havuzu var," diye ekliyor. "Eksik olan, bir başkasının yaptıklarına bakmasına izin verme isteği."

Lüks Malta Yazı + İngilizce

Kaynak: Dark Reading