Yapay Zeka

Anthropic ve OpenAI güvenlik değerlendiricilerini şirket içine almak istiyor. Gerçekten bağımsız olacaklar mı?

Anthropic ve OpenAI güvenlik değerlendiricilerini şirket içine almak istiyor. Gerçekten bağımsız olacaklar mı?
Malta'da Hem Öğren Hem Çalış

Hafta sonu yayımlanan uzun bir yazıda Anthropic CEO'su Dario Amodei, yapay zeka sektörünün bir yıl öncesine kadar anında reddedeceği bir öneride bulundu: tüm öncü yapay zeka şirketlerinin içine üçüncü taraf değerlendiriciler yerleştirilsin ve bu değerlendiricilere güvenlik olaylarını raporlama, yapay zeka modellerinin gerçekten uyumlu olup olmadığını değerlendirme ve bulgularını olduğu gibi dünyayla paylaşma yetkisi verilsin.

Amodei, Anthropic'in METR ve Redwood Research gibi bağımsız değerlendiricilere şirket sistemlerine eşi görülmemiş erişim sağlayacağını söyledi. CEO Sam Altman da OpenAI'nin bu uygulamaya taahhüt edeceğini belirtti ve bu durum sektörün dış araştırma gruplarıyla çalışma biçiminde potansiyel olarak köklü bir değişime işaret etti.

TechCrunch'a konuşan üçüncü taraf değerlendiriciler öneriyi genel olarak memnuniyetle karşıladı ancak, bu değerlendiricilerin gerçekten bağımsız gözcüler mi yoksa yapay zeka şirketlerinin şartlarıyla çalışan satıcılar mı olacağını bilebilmek için ayrıntıların netleştirilmesi gerektiğini ve bunun ideal olarak mevzuatla desteklenmesi gerektiğini söyledi.

Bu daha derin erişim, modellerin değerlendirildiklerini tanıma konusunda daha iyi hale gelmesiyle birlikte önem kazanıyor. Bu durum modellerin test sırasında iyi davranıp sorunlu davranışları gizleme riskini artırıyor. Araştırmacılar, bu davranışa dair ipuçlarının bitmiş model testinde kaçırılabileceğini ancak eğitimin tamamı boyunca nasıl davrandığının incelenmesiyle ortaya çıkarılabileceğini söylüyor.

“Yapay zeka şirketleri eğitim süreçleri hakkında çok temel bazı sorulara yanıt verebilmelidir. Örneğin: Yapay zeka, eğitim sürecinden geçerken kendi uyum eğitimini aktif olarak baltalamaya çalıştı mı? Bu sorunun cevabı kesin bir şekilde hayır olmalıdır ve şu anda bu konuda tamamen yapay zeka şirketlerine güveniyoruz; hem bunu kendileri dikkatle kontrol edecekler hem de bunu kamuoyuna doğru şekilde bildirecekler. Ve son olaylardan gördük ki varsayılan olarak ikisini de yapmıyorlar. Gömülü değerlendiriciler olarak biz bunu gerçekten kontrol edebiliriz.” Apollo Research araştırma başkanı Alexander Meinke TechCrunch'a söyledi.

Tarihsel olarak yapay zeka şirketleri, piyasaya sürmeden kısa süre önce bitmiş modelleri test etmek için dış değerlendiriciler davet etti. TechCrunch'la konuşan değerlendiriciler, onlara sadece nihai modelin değil, eğitim yaşamı boyunca oluşan ara sürümlerin ya da “kontrol noktalarının” da erişiminin verilmesini öneriyor. FAR.AI CEO'su Adam Gleave, değerlendiricilerin bu kontrol noktalarını karşılaştırarak endişe verici davranışın ne zaman ortaya çıktığını belirleyebileceğini, modellerin belirli davranışlar için ödüllendirildiği son eğitim ortamını inceleyebileceğini ve bir şirketin modelin nasıl performans gösterdiği hakkındaki iddialarını doğrulamak için değerlendirme dökümlerini ve günlüklerini kontrol edebileceğini söyledi.

Anthropic ve OpenAI'nin bu tür bir erişimi ne zaman ve nasıl sağlayacağı belirsiz. Her iki şirket de TechCrunch'ın tekrarlanan sorularına rağmen hangi değerlendiricilerle çalışacaklarını, ne zaman gömüleceklerini, kaçını işe alacaklarını, tam olarak hangi sistemlere ve bilgilere erişebileceklerini ya da kamuya neyin açıklanabileceğini paylaşmadı.

Bunu incelemek önemli çünkü güvenlik testlerinde iyi performans gösteren modeller, o testi geçmek için özel olarak öğrenmişlerse güvenli olmayabilir. Palisade Research strateji başkanı John Steidley, yapay zekanın belirli koşullarda kapatılmaya direnip direnmediğini ölçen bir “kapatma direnci kıyaslaması” örneğine işaret etti.

“Yapay zekanın bu kıyaslamada iyi performans gösterecek şekilde özel olarak eğitilmiş olması son derece ilgili.” Steidley, bunu Volkswagen'in Dieselgate skandalıyla karşılaştırdı. Bu skandalda otomobiller emisyon testlerini tanıyacak şekilde programlanmış ve test koşullarında farklı performans göstermişti.

Gleave, anlamlı erişimin modellerin kendisinin ötesine uzanabileceğini, değerlendiricilere şirketin güvenlik uygulamalarına dair dokümantasyonunun ve kamu açıklamalarının içte olanla uyuşup uyuşmadığını kontrol etmek için çalışanlarla görüşme erişimi verilebileceğini belirtti.

Amodei, değerlendiricilere muhtemelen gerekli gördükleri erişimi verebilecek oldukça kapsamlı bir öneri de ortaya koydu. Bu öneri değerlendiricilere “risk düzeyleri, olaylar, uygulamalar ve aldıkları ya da almadıkları erişim hakkında temel bulguları Anthropic'in sansür kontrolü olmadan yayımlama” hakkı içeriyordu.

Ama değerlendiriciler, böyle bir sistemin ancak yapay zeka şirketleri gerçekten süreci kontrol etme hakkından vazgeçmeye istekliyse işleyeceğini söylüyor. Bağımsız değerlendirmelere yönelik önceki çabalar, üçüncü tarafların erişim, süre, gizlilik ve kamuya ne söyleyebilecekleri konusunda gerilimlerle sık sık karşılaştığını gösteriyor.

Gleave, FAR.AI'nin değerlendirme sürecinde çok fazla kontrol isteyen birkaç öncü geliştiricinin sözleşmesini bağımsızlığını tehdit ettiği için reddetmek zorunda kaldığını söyledi. Varsayılan olarak değerlendiriciler sıradan yükleniciler gibi muamele görüyor: kısıtlayıcı gizlilik anlaşmalarına bağlılar ve geliştiricilere nihai olarak neyin yayımlanabileceği üzerinde önemli kontrol veren anlaşmalarla çalışıyorlar.

Zaman sınırı

İncelemecilerin kendilerine verilen işi yapabilmek için yeterli süre ve erişim alıp almayacağı sorusu da var. Hugging Face olayını araştırırken OpenAI, METR ve Redwood'a yerinde yaklaşık bir hafta inceleme süresi verdi ve her ikisi de kapsam ve zamanlama sınırlamaları nedeniyle, kısmen bu yüzden, kendinden emin sonuçlar çıkaramadıklarını söyledi.

Benzer bir sorun, OpenAI'nin şimdiye kadarki en uyumlu modeli olarak övdüğü GPT-6 Astra'nın piyasaya sürülmeden önceki testinde yaşandı. Model kartına Apollo Research'ün katkısına göre, firmaya Astra'yı test etmek için yalnızca üç gün verildi ve bu durum sağlam sonuçlar çıkarmayı zorlaştırdı.

“Apollo, değerlendirme farkındalığının daha yüksek oranları ve sınırlı değerlendirme penceresi göz önüne alındığında, burada görülen düşük kötü davranış oranlarının modelin uyumu ya da uyumsuzluğu hakkında önemli kanıt sağlamadığına inanıyor.” Firma değerlendirmesinde yazdı.

Bu geçmiş, değerlendiricileri temel bir soruyla baş başa bırakıyor: Bu sefer neden farklı olsun?

“Dario ve Sam'in fikir değiştirmiş olması ve bu konuda çok açık olmaları kesinlikle mümkün.” Gleave söyledi. “Ama bu şirketlerin fikri mülkiyeti onlar için inanılmaz derecede değerli ve varsayılan olarak neyin paylaşılabileceğine dair çok dikkatli olacaklarını düşünüyorum.”

TechCrunch'la konuşan birkaç araştırmacı, herkesin kamuya açık olarak üzerinde anlaştığı şeffaf bir çerçeve çağrısında bulundu. Steidley'e göre çerçevenin bir parçası, şirketlerin hangi tür denetçilere güvenebileceğine dair standartları içermeli; aksi halde şirketler nitelikli olmayan ya da en endişe verici riski değerlendirmeyi istemeyen değerlendiriciler bularak konuyu atlatmaya çalışabilir.

Safer AI icra direktörü Henry Papadatos, kamuya açık bir çerçeve olsa bile sorunun gönüllü önlemlerin her zaman bir şirketin iyi niyetine bağlı olması olduğunu söylüyor.

“İdeal olarak, bu konuda şirketler yarın büyük bir PR krizi yaşadıklarında fikirlerini değiştiremeyeceği için iyi bir düzenleme ile zorunlu kılınmasını isteriz.” Papadatos TechCrunch'a söyledi ve bunun aynı zamanda kurallara yalnızca en istekli şirketlerin değil tüm şirketlerin uymasını sağlamanın iyi bir yolu olduğunu belirtti.

Herkes bu öneriye katılmadı. Şimdiye kadar Meta, SpaceXAI ve Google DeepMind üçüncü taraf değerlendiricilerin gömülmesine taahhüt etmedi, ancak DeepMind CEO'su Demis Hassabis öncü modelleri bağımsız olarak test etmek için ayrı bir sektör standartları organı önerdi. Google, OpenAI ve Anthropic de haftalarca yapay zeka güvenliği planlarını özel olarak tartışıyor.

Üçüncü taraf değerlendiriciler fikri etrafında bazı yasalar oluşmaya başladı. Geçen yıl yasalaşan California'nın SB 53'ü, büyük öncü yapay zeka geliştiricilerinin güvenlik çerçevelerini yayımlamasını ve kritik güvenlik olaylarını raporlamasını gerektiriyor. Bu ay imzalanan yeni yasa SB 813 ise eyalet tarafından tanınan yapay zeka risklerini değerlendirme uzmanlığına sahip “bağımsız doğrulama kuruluşları” için bir çerçeve oluşturuyor.

Avrupa'da AB Yapay Zeka Yasası, öncü geliştiricilerin model değerlendirmelerini ve karşıt testleri yapmasını ve belgelemesini ve ciddi olayları raporlamasını gerektiriyor. AB Yapay Zeka Ofisi de kendi değerlendirmelerini yapabiliyor ve bağımsız uzmanlar atayabiliyor.

Şu anda yasa Amodei'nin önerdiği kadar geniş değil ve öncü laboratuvarlar büyük ölçüde ne kadar bağımsız denetime tabi olacaklarını kendileri belirliyor. Papadatos, gönüllü öz düzenlemeyi hiçbir şey olmamasından daha iyi olduğunu söyledi ancak sonuçta şirketler kendi güvenlik kurallarını kontrol etme özgürlüğünü talep edemez ve kamuoyundan bunlara uyduklarına dair güven de bekleyemez.

“Dışarıda sıfır hesap verebilirliğe sahip olmak ve sonra ‘Ben kendi esnek kurallarımı koyacağım’ demek ikisi bir arada olamaz.” Papadatos söyledi.

Uzun dönem Malta'da, üniversite destekli okullarda dilini geliştir. Kayıt bilgisi →

Kaynak: TechCrunch