OpenAI, bugün GPT-Live-1 ve GPT-Live-1 mini adlı iki yeni ses modelini yayınlıyor. Şirket, bu modellerin ChatGPT'nin ses işlevselliğine büyük iyileştirmeler getirdiğini söylüyor. Hatırlanacağı üzere OpenAI, 2024 yazında Advanced Voice Mode'u piyasaya sürmüştü. İlk çıktığında etkileyiciydi ve Siri ile Alexa gibi eski ses asistanlarına göre büyük bir adımdı, ancak zamanla sınırlamaları daha belirgin hale geldi. Özellikle Advanced Voice Mode, OpenAI'nin 'sıra tabanlı' olarak tanımladığı bir ses modeli kullanıyordu; bu, adından da anlaşılacağı gibi çalışıyordu. Modelin yanıt verebilmesi için kullanıcının konuşmayı bırakmasını beklemesi gerekiyordu. Tahmin edilebileceği gibi, bu genellikle doğal olmayan bir ileri-geri diyaloga yol açıyordu. Üstelik model, konuşmaya başlama işareti olarak sessizliği kullandığından, kısa bir duraklamayı sık sık sorunun veya istemin sonu sanıp konuşmaya başlıyor ve bu da rahatsız edici kesintilere neden oluyordu.
Buna karşılık, GPT-Live-1 ailesi modeller çift yönlü (duplex) bir mimari üzerine inşa edildi. Aynı anda girdileri işleyip çıktı üretebiliyorlar. OpenAI, 'Bu, modelin daha doğal bir ileri-geri diyalog kurmasını, zaman algısını daha iyi korumasını ve hatta canlı çeviri yapmasını sağlıyor' diye açıklıyor. Aynı zamanda şirket, GPT-Live'ı görevleri devredecek şekilde tasarladı. Yeni ses modelleri, sorunuzun veya isteminizin akıl yürütme, web araması veya daha aracı benzeri yetenekler gerektirdiğini belirlerse, yardım için GPT-5.5 dahil OpenAI'nin diğer modellerine başvurabiliyor. Bu sistemler arka planda çalışarak GPT-Live ile sohbetinize devam etmenizi sağlıyor.
Tüm bu değişiklikler, OpenAI'nin insanların daha kullanışlı bulacağını düşündüğü bir ses deneyimi ortaya çıkarıyor. Yeni ses modellerini istediğiniz zaman bölebilir, hatta çok hızlı konuştuklarını düşünüyorsanız yavaşlamalarını isteyebilirsiniz. Siz konuşurken 'mhmm' ve 'anladım' gibi sözlü onaylarla dinlediklerini teyit edecekler. OpenAI, yeni modelleri arka planda dikkat dağıtıcı gürültüler olduğunda daha iyi odaklanacak şekilde geliştirdiğini söylüyor. ChatGPT Voice artık hava durumu, spor, hisse senetleri ve daha fazlası gibi konular için widget benzeri kartlar şeklinde görseller de oluşturabiliyor. Daha önce olduğu gibi, görsel ve dosya yükleme desteği de özelliğe entegre edilmiş durumda ve web araması için de kullanılabiliyor.
Aynı zamanda OpenAI, ChatGPT Voice'a yeni güvenlik önlemleri eklediğini belirtiyor. Şirket, 'Sistem potansiyel olarak güvensiz bir çıktı tespit ettiğinde, modeli daha güvenli bir yanıta yönlendirebilir, ek güvenlik mesajı gösterebilir veya yüksek riskli durumlarda sesli konuşmayı sonlandırabilir' diyor. Ebeveynler ve vasiler, OpenAI'nin yakın zamanda kullanıma sunduğu ebeveyn kontrollerini kullanarak gençler için ChatGPT Voice'u devre dışı bırakabiliyor. Çocuklarına ChatGPT Voice erişimi verdilerse ve sistem çocuğun konuşmayı kendine zarar verme yönünde yönlendirmeye çalıştığını tespit ederse, sistemi ebeveyne bildiriyor.
OpenAI, GPT-Live'ı bugünden itibaren Android, iOS ve web'de ChatGPT'ye sunmaya başlıyor. GPT-Live 1, Go, Plus ve Pro abonelikleri için varsayılan model olurken, ücretsiz hesaplar daha küçük olan Live-1 mini modelini kullanacak.