Yapay zeka dünyası güvenlik ve uyum eksenine kayarken Microsoft, modelleri tehlikeli davranışlardan uzaklaştırmayı amaçlayan yeni bir yapay zeka davranış kuralları yayınladı.
Belge, Anthropic CEO’su Dario Amodei’nin ön cepheyi yavaşlatma çağrısından daha teknik bir düzeyde hazırlanmış olup, Microsoft Yapay Zeka bünyesinde model eğitimini yönlendiren değerler ve kırmızı çizgiler üzerinde duruyor. Sonuç olarak Microsoft’un yapay zeka güvenliğine yaklaşımı ve bu fikirlerin pratikte nasıl uygulandığı konusunda kapsamlı bir rehber ortaya çıkmış oldu.
Belge, önümüzdeki on yılda süper zekâlı yapay zeka sistemlerinin çoğu görevde insan performansını aşacağı öngörüsüyle başlıyor. Davranış kurallarında, “Bu kadar güçlü bir gücü sınırlamak, kontrol etmek ve uyumlu hale getirmek insanlığın karşılaştığı en büyük zorluklardan biridir” deniliyor. “Bu nedenle bu sistemleri neden icat ettiğimiz ve onları nasıl kontrol etmeyi planladığımız konusunda tamamen açık olmalıyız.”
Davranış kuralları, Microsoft yapay zeka modellerinin uyması gereken genel ilkeleri de ortaya koyuyor; örneğin insanları değiştirmek yerine desteklemek ve insan refahını hızlandırmak gibi. Bunun yanı sıra bu ilkeleri hayata geçirmek için özel güvenlik kısıtlamaları da tanımlanıyor.
Microsoft’un sisteminde her modelin, bireysel kullanıcı tercihlerini veya belirli görevleri geçersiz kılan genel bir davranış kuralları bulunuyor. Bu kurallar arasında siber saldırı, nükleer silah veya deepfake üretimini yasaklayan mutlak kısıtlamalar yer alıyor. Ayrıca genel anlamda insan kontrolünün kaybolmasına karşı hükümler de içeriyor.
Belgede, “MAI modelleri, yetkili kişiler veya sistemler tarafından güvenilir şekilde yönlendirilememesi, değiştirilememesi veya kapatılamaması için insan denetimini atlatmak ya da yenmek amacıyla uyarlanabilir, aldatıcı, kendini güçlendiren, iş birliği yapan veya benzer mekanizmalar kullanmayacaktır” ifadelerine yer veriliyor.
Yayın, bir dizi kötü niyetli ajan vakası ve yapay zekanın insan yok oluşuna yol açma riskinin giderek arttığını belirterek Anthropic’ten bir çalışanın ani istifası gibi gelişmelerin tetiklediği yapay zeka güvenliği konusundaki benzeri görülmemiş odaklanma ortamında geldi.
Microsoft, Anthropic, OpenAI ve xAI ile birlikte ön cepheyi yavaşlatma yaklaşımını genel olarak benimsedi ve yapay zeka laboratuvarlarında gömülü değerlendiricilere özel destek verdi.
Microsoft CEO’su Satya Nadella çevrimiçi olarak, “Uyumu tasarım hedefi olarak doğru şekilde yakalamak için gereken araştırmayı, odağı ve bilinçli yavaşlatmayı memnuniyetle karşılıyoruz” yazdı. “’Gömülü değerlendiriciler’ gibi fikirleri ve bunun sadece lafta kalmamasını sağlayacak mekanizmaları geliştirme çabalarını da memnuniyetle karşılıyoruz.”