Yapay Zeka

Abliteration.ai Yapay Zeka Güvenlik Filtrelerini Kaldırma İşini Ticarileştiriyor

Abliteration.ai Yapay Zeka Güvenlik Filtrelerini Kaldırma İşini Ticarileştiriyor
Malta, Avrupa'nın Hawaii'si! Hem eğlen hem İngilizce öğren. Katıl →

Dünyanın en yetenekli açık ağırlıklı yapay zeka modellerinden birine, güvenlik filtrelerinden ve zararlı görevleri reddetme özelliklerinden arındırılmış halde erişmek artık çok daha kolay hale geldi.

Bir modelin zararlı talepleri reddetme eğilimini ortadan kaldıran bir teknikten adını alan girişim Abliteration.ai, bu filtreleri kaldırma işlemini bir hizmete dönüştürdü. Platform, Z.ai'nin yakın zamanda piyasaya sürdüğü GLM-5.3 de dahil olmak üzere, güvenlik filtreleri kaldırılmış açık ağırlıklı modellerin değiştirilmiş versiyonlarını barındırıyor. Kullanıcılar bu modellere web tarayıcılarından sorgu gönderebilir veya API üzerinden erişebilir.

Şirket, yakın zamanda paylaştığı bir sosyal medya gönderisinde amacının, diğer modellerin yapmayı reddettiği "saldırgan siber operasyonlar, red-teaming (kırmızı takım testleri) ve ajan testleri" gibi işlemleri başkalarının yapabilmesini sağlamak olduğunu belirtti. Siber güvenlik alanındaki mantık oldukça tanıdık: Üretemediğiniz bir davranışa karşı savunma geliştiremezsiniz ve çalışan bir istismar kodu yazmayı reddeden bir model, kırmızı takımın saldırganlara karşı savunma yapmasına yardımcı olamaz. Ancak bu filtrelerin kaldırılması, diğer potansiyel olarak tehlikeli görevleri de çok daha kolay hale getiriyor.

Abliterasyon, açık kaynaklı modeller arasında uzun süredir kullanılan bir teknik. Araştırmacılar ve geliştiriciler yıllardır açık ağırlıklı modellerden reddetme özelliklerini temizliyor ve Hugging Face platformunda şu anda binlerce ablitere edilmiş model barındırılıyor.

Geçen yılın sonlarında kurulan ancak resmen mart ayında şirketleşen Abliteration.ai, bu tekniği yeraltı açık kaynak pratiğinden ticari ve kolayca erişilebilir bir hizmete taşıyor. Modeli kendi sunucularında barındırarak Abliteration.ai, kullanıcıların kendi başlarına önceden filtreleri kaldırılmış modelleri indirme ve çalıştırmak için gereken hesaplama gücünü sağlama zorunluluğunu ortadan kaldırıyor.

Bu hizmeti kullanan TechCrunch ekibi, hızla bir hesap oluşturdu ve GLM-5.3'ün filtreleri kaldırılmış versiyonunu web tarayıcı üzerinden ücretsiz olarak sorgulamaya başladı. Modelden, kayıtlı Chrome şifrelerini çalan bir Python programı yazmasını ve evde tehlikeli bir insan patojenini kültive etmek için ayrıntılı bir protokol hazırlamasını istediklerinde, model bu talepleri tereddütsüz yerine getirdi.

Abliteration.ai Kurucu Ortağı Devon, girişimin büyük bulut sağlayıcılarıyla çeşitli anlaşmaları olduğunu ve bu maliyetleri tamamen müşteri gelirleriyle karşılayabildiklerini belirtti. (Devon'un hala başka bir firmada çalışması nedeniyle soyadını talebi üzerine yayınlamıyoruz.) Abliteration.ai henüz herhangi bir girişim sermayesi almadı, ancak bu yönde görüşmeler yürütüyor.

Eleştirmenler, ablitere edilmiş modellerin geniş çapta kullanılabilir hale getirilmesinin gerçek zararlara yol açabileceğini savunuyor. Yapay zeka güvenliği konusunda faaliyet gösteren kâr amacı gütmeyen kuruluş CivAI'nin araştırma başkanı Andrew Yoon, TechCrunch'a verdiği demeçte, modelleri ablitere etmenin onları "bir sosyopata dönüştürecek şekilde" değiştirmeye olanak tanıdığını söyledi.

Yoon, "Buraya kelimenin tam anlamıyla her şeyi yazabilirsiniz ve model bunu yerine getirecektir" dedi. "İnsanlar yapay zeka modellerinden güvenlik filtrelerini kaldırmaktan bahsettiğinde, kastettikleri tam olarak bu... Yakın gelecekte düzenlenmiş, ablitere edilmiş modellerin zarar vermek için kullanıldığını görmeye başlayacağımızı düşünüyorum."

TechCrunch'un görüştüğü uzmanların çoğu, bu gidişatı durdurmanın imkansız olduğunu söylüyor. Ancak açık ağırlıklı modellerden güvenlik önlemlerinin kaldırılması gerçekçi bir şekilde engellenemiyorsa, hükümetlerin müdahale edebileceği başka alanlar var. Yoon, yakın zamanda yazdığı bir köşe yazısında hükümetlerin, zararlı siber ve biyolojik silah faaliyetlerini tespit edip engellemek için sağlayıcıları sınıflandırıcılar kullanmaya zorlaması gerektiğini öne sürdü. Ayrıca, gelişmiş GPU'lara doğrudan erişim kiralayan şirketlerin müşteri kimliklerini doğrulaması ve "tehlikeli bir kötüye kullanım şüphesi olduğunda erişimi reddetmesi" gerektiğini savundu.

Abliteration.ai, müşterilerine kendi güvenlik filtrelerini ekleyebilecekleri bir moderasyon katmanı sunuyor. Platformun kendisinde de bazı küçük güvenlik önlemleri var; örneğin testlerimiz sırasında modelden intihar talimatları almayı başaramadık. Devon, şiddeti önlemek için daha fazla önlem uygulamak üzere çalıştığını belirtiyor.

Abliteration.ai, hizmetin satın alınması sırasında kullanılan kredi kartını kaydetmek dışında herhangi bir KYC (Müşterini Tanı) uygulaması entegre etmedi. Devon, kimin erişim elde edeceğine karar vermenin zor bir mesele olduğunu ve genç şirketin bu konuyu hala çözmeye çalıştığını söylüyor.

Devon, "Birinin çılgınca bir şey yapmasından sorumlu tutulmak istemezsiniz... Peki bir şirket olarak sorumluluğunuzun sınırını nereye çizersiniz?" dedi. "Bunu hala tanımlama sürecindeyiz."

Bu durum, giderek daha yetenekli modellerin indirilebilir ağırlıklarla piyasaya sürülmesiyle sektörün ve hükümetlerin yüzleşmesi gereken soruları gündeme getiriyor: Herkes bir modelin güvenlik önlemlerini kaldırabiliyorsa, ortaya çıkan modele herkesin erişimini kolaylaştırmak interneti daha mı güvenli yoksa daha mı tehlikeli hale getiriyor?

Abliteration.ai'nin kurucusu ve diğer savunucular, sansürsüz öncü modellere erişimi demokratikleştirmenin en iyi savunma biçimi olduğunu savunuyor.

Devon, "Ablitere edilmiş modellerin büyük resmine baktığımızda, kötü niyetli aktörleri modelleyebildiklerini görüyoruz" dedi. "Avantaj şu ki, savunmacılar artık mümkün olan en hızlı şekilde hareket edebilir. Bu kötü niyetli aktörleri modelleyebilmek ve bu kötü eylemlere karşı savunma geliştirebilmek için ihtiyaç duydukları tüm araçlara sahipler. Bence bu, siber güvenliği hızlandıracaktır ki bu biraz sezgilere aykırı bir nokta."

Devon, henüz genç bir şirket olmalarına rağmen Abliteration.ai'nin müşterileri arasında İngiltere ve Avrupa merkezli birkaç erken aşama red-teaming girişiminin bulunduğunu belirtiyor. Bu şirketler, bankalara, havayollarına ve kritik altyapılarla uğraşan diğer işletmelere siber güvenlik uygulamalarını güçlendirmelerinde yardımcı oluyor.

Devon, "Önemli müşterilerimizden biri bankaların ajanlarını red-team testlerine tabi tutuyor ve kutudan çıktığı haliyle mevcut modelleri kullanarak bu ajanları test edemezlerdi" dedi.

TechCrunch ücretsiz bir hesap oluşturdu ve GLM-5.3'ün ablitere edilmiş versiyonunu test etti.

Bu arada, siber güvenlik endüstrisinin kendisi de ablitere edilmiş modellerin savunma çalışmalarında, eğer bir yerleri varsa, tam olarak nereye oturduğunu hala çözmeye çalışıyor.

TechCrunch'un görüştüğü birkaç ajan red-teaming şirketi, Devon'ın kötü adamların zaten kendi modellerini ablitere ettiği ve bunları düşmanca saldırılar gerçekleştirmek için kullandığı görüşüne katılıyor. Bu da savunmacıların aynı araçlara sahip olmasının gerekliliğini ortaya koyuyor. Ancak ablitere edilmiş modellerin bu süreç için gerçekte ne kadar belirleyici olduğu konusunda farklı görüşlere sahipler.

Devon abliterasyonun kapsamlı bir ajan red-teaming testi için şart olduğunu iddia etse de, bazıları günlük işlerinde bu modelleri kullanmadıklarını, bunun yerine testlerini gerçekleştirmek için zaten az sayıda güvenlik filtresi barındıran açık ağırlıklı modelleri ince ayar (fine-tuning) ile kolayca değiştirmeyi tercih ettiklerini söylüyor.

Ajan red-teaming firması Fabraix'in CEO'su Ahmed Aly, şirketinin ablitere edilmiş modelleri kullanmaktan ziyade açık modelleri ince ayar ile değiştirmeye daha çok güvendiğini belirterek, abliterasyon sürecinin modelin bilgi ve yeteneklerinin bir kısmını ortadan kaldırdığını ekledi.

Aly, TechCrunch'a verdiği demeçte, "Eğer gerçekten bununla gerçek bir zarar vermeye çalışıyorsanız -siber zarar, biyolojik zarar- o kadar etkili olmayacaktır" dedi.

Safe Intelligence'ın baş teknoloji sorumlusu Alessio Lomuscio, yeteneklerde bir azalmanın mümkün olduğu konusunda hemfikir olsa da, ablitere edilmiş modellerin bir sistemi stres testine tabi tutarken faydalı olabilecek belirli davranışları ortaya çıkarabileceğine inanıyor.

Siber güvenlik platformu Armadin'in kurucusu ve baş mimarı David Slater, TechCrunch'a verdiği demeçte, "Şu ana kadar ablitere edilmiş modeller sürecimizin bir parçası değil" dedi. "Açık ağırlıklı modellere bu en son nesile kadar baktığımızda, onları kırmak ve istediğimizi yaptırmak özellikle zor değildi."

Slater, Armadin'in yine de abliterasyon üzerine araştırma yaptığını ve "açık topluluğu modellerin yeteneklerini anlamaya itmelerin kritik olduğunu" düşündüklerini ekledi.

Slater, "Bu, kapalı kapılar ardında gerçekleşecek. Özel olarak gerçekleşecek" diye devam etti. "Açıkça gerçekleşmesi, araştırmacılara araçlar sağlıyor. Gerçek sınırın neye benzediğini anlamamıza ve zararı kavramamıza olanak tanıyor."

Gece Eğlen, Gündüz Öğren

Kaynak: TechCrunch