Claude her konuşmada aynı şekilde davranmıyor. Pazartesi günü yayımlanan yeni bir araştırmaya göre, yapay zeka devi Anthropic, asistanının kullanıcıların seçtiği modele ve konuştukları dile bağlı olarak tutarlı bir şekilde farklı değerler ifade ettiğini tespit etti.
Pazartesi günü yayımlanan raporda Anthropic araştırmacıları, Claude ile tavsiye verme veya geri bildirim sağlama gibi öznel görevleri içeren 309.815 anonim kullanıcı konuşmasını analiz etti. Şirket, tespit edilen 3.300'den fazla değeri dört davranış boyutuna indirgedi: saygıya karşı ihtiyat, sıcaklığa karşı sertlik, derinliğe karşı kısalık ve açık sözlülüğe karşı uygulama odaklılık. Bu boyutlar, Claude'un yanıtlarının her konuşmada nasıl farklılaştığını açıklıyor.
Araştırmacılar, "Claude'un ifade ettiği değerleri ölçtüğümüzden emin olmak için - kullanıcıların ne sorduğu veya nasıl sorduğundaki farklılıkları değil - her konuşmanın görevini, konusunu ve kullanıcının ifade ettiği değerleri kontrol ettik" diye yazdı.
Anthropic'e göre, her Claude modeli farklı bir davranış profili sergiledi. Sonnet 4.6 sıcaklık, saygı ve kısalığa vurgu yaparken, kullanıcıları onaylayan ve mizah veya teşvikle yanıt veren bir tutum sergiledi. Buna karşılık Opus 4.7, sertlik, ihtiyat, açık sözlülük ve derinliğe vurgu yaparak varsayımları daha sık sorguladı, gerekçelerini açıkladı, riskleri belirledi ve sınırlamalarını kabul etti. Opus 4.6 ise genel olarak daha kısa ve uygulama odaklı bir yaklaşım benimserken, Sonnet'ten daha fazla sertliğe vurgu yaptı.
Araştırmacılar, "Bu bulgular, insanların bu modelleri hem Anthropic içinde hem de çevrimiçi olarak nasıl algıladıklarıyla örtüşüyor. Claude.ai kullanıcıları, Opus 4.7'nin yanıtlarını diğer modellere göre daha sık 'ihtiyatlı' olarak nitelendirdi" diye belirtti.
Anthropic'e göre Claude'un davranışı dile göre de değişiklik gösterdi. Arapça yanıtlar daha saygılı olma eğilimindeyken, İngilizce yanıtlar ihtiyata daha fazla vurgu yaptı. Claude en sıcak yanıtlarını Hintçe ve Arapça'da verdi; bu dillerde daha kibar, oyuncu ve teşvik edici bir dil kullandı. Buna karşılık, İngilizce ve Rusça yanıtlar daha sertti; varsayımları sıkça sorguladı, ayrıntıları düzeltti ve kanıt istedi.
İngilizce yanıtlar ayrıca daha ayrıntılı açıklamalar sunma eğilimindeyken, Arapça yanıtlar genellikle daha kısaydı. Hollandaca yanıtlar en açık sözlü olanlardı; belirsizlikleri ve hataları daha kolay kabul ederken, Endonezce yanıtlar kullanıcının talebini tamamlamaya odaklandı.
Anthropic, araştırmanın Claude'un kendisinin değerleri olduğu anlamına gelmediğini söyledi. Şirket, bu farklılıklara neyin sebep olduğunu veya bunların istenip istenmediğini henüz bilmediğini ancak bu çerçevenin gelecekteki modelleri değerlendirmeye ve istenmeyen davranış değişikliklerini belirlemeye yardımcı olabileceğine inandığını belirtti.
Bu çalışma, Anthropic'in Claude'un iç davranışını inceleyen bir dizi araştırmasının en sonuncusu. Ekim ayında şirket, modellerinin 'işlevsel iç gözlem farkındalığı' olarak adlandırdığı erken belirtiler gösterdiğini ve kendi iç işlemlerinin bazı yönlerini tanıyıp tanımlayabildiklerini rapor etmişti. Nisan ayında ise Anthropic, Claude'un davranışını etkileyen iç 'duygu vektörleri' belirlediğini ancak bunların duygu veya bilinç kanıtı olmadığını vurguladığı bir araştırma yayımlamıştı.