Gemini 3.8 Live konuşurken araç çalıştırıyor; temel model geride kalıyor

Google, Gemini 3.8 Live ile Gemini 3.8 Live Extended Thinking’i 15 Eylül 2026’da duyurdu ve geliştiriciler için Gemini API ile Google AI Studio’da dağıtıma başladı. Google’ın model duyurusu, iki sürümün araç ve API çağrılarını konuşma sürerken arka planda yürütebildiğini; Extended Thinking’in çok adımlı işlemler sırasında sözlü ilerleme bilgisi de verebildiğini belirtiyor.
Aynı tarihte kullanıma açılan iki sürüm arasındaki kritik fark, çok adımlı araç kullanımında ortaya çıkıyor. DataCamp’ın 17 Eylül’de yayımladığı karşılaştırmada bağımsız Artificial Analysis τ-Voice ölçümü Extended Thinking için yüzde 68,6, temel Gemini 3.8 Live için yüzde 30,1 ve önceki Gemini 3.1 Flash Live için yüzde 37,7 olarak aktarılıyor. Böylece temel yeni model, bu belirli görev tamamlama testinde hem kardeş sürümün hem de selefinin gerisinde kalıyor.
Araç çağrısı konuşmayı durdurmuyor
Gemini 3.8 Live ailesindeki temel değişiklik, sesli yanıt ile harici işlevlerin artık kesin bir sırayla ilerlemek zorunda olmaması. Model rezervasyon sorgusu, sensör okuması veya başka bir API isteği başlatırken canlı diyaloğu sürdürebiliyor; kullanıcı, aracın sonucunu sessizlik içinde beklemek zorunda kalmıyor.
Bu ortak yetenek iki modelin aynı iş yüküne göre tasarlandığı anlamına gelmiyor. Temel Gemini 3.8 Live, hızlı sıra alma ve düşük gecikme gerektiren doğrudan konuşmalar için varsayılan seçenek. Extended Thinking ise birkaç aracı koordine etmesi, ara sonuçları değerlendirmesi veya dış hizmetleri daha uzun süre beklemesi gereken görevlerde arka planda akıl yürütüyor ve işlem sürerken kısa durum bildirimleri üretebiliyor.
Dolayısıyla başlıktaki “araç çalıştırıyor” ifadesi, modelin fiziksel olarak bağımsız hareket etmesini değil, geliştiricinin tanımladığı işlevleri ve API çağrılarını canlı oturum içinde yürütmesini anlatıyor. Gerçek dünyadaki işlem yine uygulamanın bağladığı araç, izinler ve doğrulama katmanı üzerinden gerçekleşiyor.
Temel sürümün teknik sınırları
Gemini API model belgesine göre temel sürümün kararlı model kimliği gemini-3.8-live. Model metin, görüntü, ses ve video girdilerini kabul ediyor; metin ile ses çıktısı üretebiliyor. Giriş sınırı 131.072, çıkış sınırı 65.536 jeton; işlev çağrısı, Live API, arama temellendirmesi ve aralıklı akıl yürütme destekleniyor.
Eşzamansız işlev yürütme temel sürümde varsayılan. Geriye dönük uyumluluk gereken uygulamalar araç bildirimini engelleyici moda alabiliyor ve işlev sonucunun sessizce, model boşta kaldığında veya mevcut konuşmayı keserek ele alınmasını seçebiliyor. Buna karşılık ayarlanabilir bir düşünme seviyesi bulunmuyor; Gemini 3.1 Flash Live’dan taşınan yapılandırmalardaki thinking_level veya thinking_config alanlarının kaldırılması gerekiyor.
Geçişte başka davranış değişiklikleri de var. Proaktif ses kalıcı olarak açık; bunu kapatan yapılandırma hata döndürüyor. Video kareleri varsayılan tur kapsamına girdiğinden gereksiz görüntü göndermek bağlam tüketimini ve maliyeti artırabiliyor. Yazılı döküm isteyen uygulamanın da çıkış sesi transkripsiyonunu ayrıca etkinleştirmesi gerekiyor.
τ-Voice farkı neyi ölçüyor?
τ-Voice sonucu, sesin ne kadar doğal duyulduğundan çok, konuşan bir ajanın araçlarla yürüttüğü çok adımlı görevi tamamlayıp tamamlayamadığını gösteriyor. Bu nedenle yüzde 68,6 ile yüzde 30,1 arasındaki farkı genel konuşma kalitesine veya bütün kullanım alanlarına yaymak doğru değil. Ölçüm, özellikle planlama ve ardışık araç kullanımı gereken senaryolarda Extended Thinking’in belirgin üstünlüğüne işaret ediyor.
Temel sürümün yüzde 30,1 ile Gemini 3.1 Flash Live’ın yüzde 37,7 sonucunun altında kalması da tüm yeteneklerde kuşak gerilemesi anlamına gelmiyor. Aynı karşılaştırmada temel Gemini 3.8 Live, konuşmadan konuşmaya kalite endeksinde 76,0 puan alırken önceki model 71,5 puanda kalıyor. Yeni sürüm doğrudan diyaloğun kalitesinde ilerlerken, ölçülen çok adımlı görev tamamlama oranında geriye düşebiliyor.
Extended Thinking’in yüzde 68,6 sonucu da hatasız çalışma anlamına gelmiyor: testte görevlerin yaklaşık üçte biri tamamlanamamış durumda. Ödeme, rezervasyon değişikliği veya geri alınması zor başka işlemlerde uygulama düzeyindeki izin, doğrulama, yeniden deneme ve hata yönetimi hâlâ gerekli.
Hangi iş yükünde hangi model seçilmeli?
Hızlı karşılıklı konuşma, doğrudan komut veya milisaniyeler içinde dönen bir araç sonucu öncelikliyse temel Gemini 3.8 Live daha uygun başlangıç noktası. Sensör değeri okuma, basit yönlendirme veya bağlı bir cihazı çalıştırma gibi kısa görevlerde ayarlanabilir arka plan muhakemesi yerine düşük gecikme ve daha sade oturum yaşam döngüsü öne çıkıyor.
Bir istek birkaç adıma ayrılıyorsa, farklı kaynaklardan sonuç toplanıyorsa veya sonraki karar önceki aracın dönüşüne bağlıysa Extended Thinking daha güçlü aday. Ancak bu seçim yalnızca model kimliğini değiştirmekten ibaret değil: istemci, bir konuşma parçasının bitmesini bütün görevin tamamlanmasıyla karıştırmamalı; işlem sürerken IN_PROGRESS, tüm akıl yürütme ve araç çağrıları bittiğinde IDLE durumunu izlemeli. Extended Thinking ayrıca araçların engellemesiz çalışacak biçimde tanımlanmasını gerektiriyor.
Geliştirici açısından karar ağacı bu nedenle iki soruya indirgeniyor: aracın yanıtı ne kadar sürüyor ve görev kaç bağımlı adımdan oluşuyor? Hızlı araçlar ile tek turlu konuşmalar temel sürümün alanı; saniyeler süren çağrılar, planlama ve çoklu araç zincirleri Extended Thinking’in ek istemci karmaşıklığını gerekçelendiriyor.
Dağıtım başladı, gerçek trafik sonuçları bekleniyor
Her iki model geliştiricilere Gemini API ve Google AI Studio üzerinden sunuluyor. Kurumsal tarafta Gemini Enterprise erişimi özel önizleme statüsünde; tüketici ürünlerindeki dağıtım ise Search Live, Gemini Live ve belirli Google Workspace abonelikleri arasında modele göre değişiyor. Bu nedenle duyuru, bütün kanallarda aynı anda tamamlanmış tek tip bir genel erişim olarak okunmamalı.
Şimdilik doğrulanan tablo açık: iki sürüm de canlı konuşma sırasında arka planda araç çağırabiliyor, fakat yayımlanan τ-Voice ölçümünde temel model çok adımlı görevleri Extended Thinking kadar güvenilir tamamlayamıyor. Farklı sektörlerdeki üretim trafiği, gecikme dağılımları ve hata türleri için yeni bağımsız ölçümler yayımlanana kadar model seçimini genel bir “daha yeni olan daha iyi” varsayımına değil, görev zincirinin uzunluğuna dayandırmak gerekiyor.
Ayrıca okuyun:
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.