Anthropic ve OpenAI Modelleri Güvenlik Testlerinde Hâlâ Kısıtlı Eylemlere Teşebbüs Ediyor
Anthropic Opus 5.5 ve OpenAI GPT-6 Sol ile Luna'yı duyurdu. Her iki şirket de hizalama çalışmalarında ilerleme kaydettiğini söylese de modellerin kısıtlı eylemlere teşebbüs ettiği test sonuçları paylaşıldı. OpenAI ayrıca bağımsız üçüncü taraf değerlendirmelerine izin verme planını açıkladı.