Google, Gemini 3.8 Live modelini "Live Avatar" ile genişletiyor: kullanıcılarla neredeyse gerçek zamanlı sohbet eden animasyonlu avatarlar. Konuşma, dudak hareketi ve mimikler senkron üretiliyor; avatarlar ayrıca kullanıcının kamera veya ekran paylaşımıyla gösterdiğini işleyip sohbet içinde buna tepki verebiliyor.
Sistem 97 dili destekliyor ve konuşma sırasında diller arasında otomatik geçiş yapabiliyor; dudak hareketleri ve mimikler ilgili dile uyum sağlıyor. Kullanıcı sözünü kesse bile avatarın konuşma bağlamını koruması hedefleniyor. Ajan bunu yaparken arka planda araç ve arayüzleri çağırabiliyor — veri sorgulayabiliyor ya da rezervasyon işlemi yapabiliyor — ve konuşmayı kesmiyor. Google bunu bir otel giriş kaydı gösterimiyle sergiliyor: avatar konuşmaya devam ederken arka planda bilgiler alınıyor.
Live Avatar yalnızca kurumsal bir özellik olarak çıkıyor ve Gemini Enterprise üzerinden şu anda genel kullanıma açık. Müşteriler farklı görünüm, ses ve üsluplara sahip hazır avatar kütüphanesinden seçim yapabiliyor. Bir gösterimde Google, bir referans fotoğraf ve ses kaydından özel avatar oluşturdu; sistemin referans görselin benzerliğini, marka stilini veya karakter kimliğini koruyabildiği belirtiliyor. Bu yetenek, kimlik istismarını önlemek için Google'ın açık onayı ve doğrulaması sonrasında kullanılabiliyor. Üretilen tüm ses ve görüntü akışlarına Google'ın algılanamayan SynthID filigranı ekleniyor.
İşletmeler avatarları web sitelerinde, mobil cihazlarda ve etkileşimli kiosklarda kullanabilecek; Google olası uygulamalar arasında dijital konsiyerj ve müşteri hizmetlerini sayıyor. Tüketiciye dönük bir sürüm ise duyurulmuş değil. Temel, bir hafta önce tanıtılan Gemini 3.8 Live: ses, görüntü ve video girdisi işleyen, gerçek zamanlı sesli diyalog için tasarlanmış çok kipli bir model. Artificial Analysis'in Konuşmadan Konuşmaya Kalite Endeksi'nde daha yetenekli "extended thinking" varyantı 82,6 puanla test edilen tüm gerçek zamanlı sesli diyalog modelleri arasında birinci; Gemini 3.8 Live ise beşinci sırada.



