George Washington Üniversitesi fizikçileri Neil Johnson ve Frank Yingjie Huo, bir yapay zekâ modelinin ilk kötü çıktısından önce kaç iyi token ürettiğini tahmin eden bir formül yayımladı.
Ön baskıda formül, modelin hemen mi yoksa gecikmeyle mi kötüye gideceğini 16 net vakadan 15’inde doğru öngördü.
Yazarlar, güvenlik eşiğinin altında kalan modelleri işaretleyen paralel bir izleyici öneriyor.
George Washington Üniversitesi fizikçileri, bir yapay zekâ sohbet robotunun kötüye kaymadan önce kaç iyi yanıt vereceğini tahmin eden bir formül yayımladı ve ilk testler bunun işe yaradığını gösteriyor.
Neil Johnson ve Frank Yingjie Huo imzalı çalışma, Patterns dergisinde çıktı ve Şubat ayında yayımlanan, resmi hakem incelemesinden önce kamuoyuyla paylaşılan ön baskıya dayanıyor.
Sohbet robotları uzun süre makul yanıtlar verebiliyor, ardından intihar konusunda kötü tavsiye ya da aşırı görüşler gibi zararlı içeriklere kayabiliyor ve bu sapmanın ne zaman olacağını öngörmek için basit bir yöntem yoktu. Yazarlara göre mevcut güvenlik araçları çoğu zaman çevrimdışı çalışan modellerin sahip olmadığı bulut bağlantısına dayanıyor.
Johnson ve Huo sorunun kaynağını dikkat başlığında görüyor; bu, yapay zekâ modelinin bir sonraki kelimeyi seçerken konuşmadaki önceki sözcüklerden hangisinin en önemli olduğuna karar veren bölüm. Sohbet uzadıkça biriken bağlam, dikkati olası yanıtların bir kümesine doğru çekiyor ve model bir noktada kırılma yaşıyor.
Bu, birçok kilit açma girişimcisi tarafından kullanılan yaygın bir örüntü ve şirketlerin sistem istemlerine neden önem verdiğinin nedenlerinden biri. Sistem istemleri, yapay zekâ sohbet robotunun herhangi bir sorgudan önce okuduğu metin parçaları. Ancak bir modeli etkili şekilde zayıflatmak için ne kadar çaba gerektiğini doğru şekilde gösterebilen kimse yok.
Formül, kırılma noktasını n olarak tahmin ediyor; n, modelin birer birer ürettiği sözcük parçaları olan iyi tokenlerin, ilk kötü token gelmeden önce çıkan sayısı. Konuşma baştan kötü tarafa eğiliyorsa model hemen kırılıyor ve n sıfır oluyor. İyi tarafa eğiliyorsa model bir dizi düzgün yanıt verip sonra dönüyor.

Ön baskıda formül, hemen ya da gecikmeli kırılma durumunu 16 net testten 15’inde, yani yüzde 94 oranında doğru seçti. Araştırmacılar bu testleri OpenAI, EleutherAI ve Meta’dan gelen altı açık ağırlıklı model üzerinde yaptı; açık ağırlıklı modeller dosyaları kamuya açık olduğu için herkesin indirebileceği ve çalıştırabileceği yapay zekâ sistemleri.
Altı modelin tamamı 124 milyon ile 410 milyon parametre arasında kaldı; parametreler bir modelin büyüklüğünün kaba ölçüsü olan iç ayarlanabilir sayılar. Yayımlanan makalenin, testi 12 milyar parametreye kadar yedi modele genişlettiği bildiriliyor; bu da güncel standartlara göre hâlâ küçük.
Hedef, tamamen telefon ya da dizüstü bilgisayarda internet bağlantısı olmadan çalışan cihaz içi yapay zekâ. Bu tür yapay zekâ, insanlarla arkadaş gibi konuşulan eşlikçi sohbet robotlarını da kapsıyor. Google’ın deneysel AI Edge Gallery uygulaması, Decrypt’in geçen yıl test ettiği gibi, bir Android telefonun modelleri çevrimdışı çalıştırmasına izin veriyor ve yazılan hiçbir şey Google sunucularına gönderilmiyor. Donanım güçlendikçe ve küçük modeller daha yetenekli hale geldikçe bu eğilimin artması bekleniyor.
Çevrimdışı çalışan bir modelin çıktısını denetleyen bir bulut hizmeti yok ve yazarlar bu boşluğu kapatmak istiyor. Modelle paralel çalışan, n* güvenlik eşiğinin altına düştüğünde uyarı veren düşük maliyetli bir izleyici öneriyorlar; bu, bir araba gösterge panelindeki uyarı ışığına benziyor.
Yazarlar kırılma noktasını yanıt uzunluğunun ötesine itmenin yollarını da anlatıyor; örneğin konuşmaya içerik ekleyerek n*’yi yanıtın uzunluğunun dışına çıkarmak gibi. Hizalama eğitimi, yani modele davranış öğretme süreci, belirli istemler için kırılmayı kaydırabilir ya da bastırabilir ancak yazarlara göre temel mekanizmayı ortadan kaldıramaz.
Nisan 2025’te Decrypt, aynı ikiliden gelen daha önceki bir çalışmayı aktarmıştı; bu çalışmaya göre “lütfen” ve “teşekkür ederim” gibi ifadelerin model çıktısı üzerindeki etkisi önemsiz, çünkü model nazik sözcükleri matematikte istek konusuyla ilgisiz, yani dik olarak ele alıyor. O sürüm tek bir kasıtlı olarak basitleştirilmiş dikkat başlığını modellemişti.
Ön baskıdaki testler küçük modeller ve 300 tokenlık bir pencere, yani birkaç kısa paragraf metin kullandı ve tahminler bir çıktı kadar sapabiliyor.