Yapay Zekâ ve Otomasyon

Gemini videoda kareleri kendi seçiyor: token kullanımı yüzde 88’e dek azalabilir

|Yazar: QUASA Editör Ekibi|4 dk okuma| 2
Gemini videoda kareleri kendi seçiyor: token kullanımı yüzde 88’e dek azalabilir

Google, 1 Eylül 2026’da Gemini API için videonun hangi bölümlerini inceleyeceğine soruya göre karar veren ajanlı video analizini kullanıma sundu. Google’ın lansman duyurusuna göre özellik, Gemini 3.7 Flash ile yapılan ölçümlerde token tüketimini yüzde 88’e, analiz maliyetini yüzde 66’ya kadar düşürdü.

1 Eylül’de kullanıma açılan mod, yüklenen videolar ve YouTube videolarıyla Gemini API üzerinden Google AI Studio ve Gemini Enterprise Agent Platform’da çalışıyor. Sabit hızla örnekleme yapmak yerine gerekli kareleri, ses parçalarını ve transkript bölümlerini seçiyor; ancak yüzde 88, her sorgu için garanti edilen bir indirim değil, testlerde ulaşılan azami sonuç.

Ajanlı mod videoyu soruya göre tarıyor

Gemini API uzun konferans kaydında ilgili anı bulup kare, ses ve transkript kanıtlarını seçiyor.

Statik işlemede kareler önceden belirlenen hızla çıkarılıp tek geçişte bağlama yerleştiriliyor. Ajanlı mod ise önce sorunun gerektirdiği kanıtı belirliyor, ardından zaman çizelgesindeki olası aralıkları tarıyor. İlgili bölümlerde kare hızını veya çözünürlüğü değiştirebiliyor; gerekirse aynı aralığın görüntüsünü, sesini ve transkriptini yeniden inceleyebiliyor.

Bu yöntem, uzun bir kaydın yalnızca küçük bir kısmında bulunan bilgiyi ararken gereksiz girdiyi azaltabiliyor. Örneğin 90 dakikalık bir konferansta belirli bir ürünün ilk gösterildiği an sorulduğunda model, tüm zaman çizelgesini aynı ayrıntı düzeyinde yüklemek yerine aday bölümleri bulup seçilen kesitlere yoğunlaşabiliyor.

Dinamik inceleme yalnızca belirli bir anı bulmaya yönelik değil. Saniyeden kısa durum değişiklikleri, hızlı harekette anomali tespiti ve tekrarlanan hareketlerin ya da nesnelerin sayılması da açıklanan kullanım alanları arasında. Böyle bir görevde model, kritik hareketi daha ayrıntılı görmek için seçtiği kısa aralığa daha yüksek kare hızıyla dönebiliyor.

Statik 1 FPS ile ajanlı işleme farklı işler için uygun

Aynı videoda tüm zaman çizelgesini kapsayan sabit 1 FPS ile seçici ajanlı işleme karşılaştırılıyor.

Gemini API video belgesi, varsayılan statik modun saniyede bir kare çıkardığını; ajanlı modun ise Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite tarafından desteklendiğini belirtiyor. Lansman 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite ile yapıldı; 2 Eylül’de güncellenen destek listesine 3.8 Flash da eklendi.

Statik mod kısa kliplerde ve başlangıç gecikmesinin önemli olduğu işlerde daha öngörülebilir. Video tek geçişte, sabit bir örnekleme düzeniyle işlendiği için girdinin süresiyle tüketim arasındaki ilişki daha kolay hesaplanabilir. Buna karşılık varsayılan 1 FPS, iki örnek arasına düşen çok kısa bir hareketi veya hızlı durum değişikliğini kaçırabilir.

Ajanlı modun tüketimi yalnızca video süresine bağlı değildir. Sorunun kapsamı, ilgili kanıtın kayıt boyunca dağılımı ve modelin kaç aralığı yeniden açtığı da sonucu etkiler. Uzun videoda tek bir konuşma parçasını bulmak az sayıda kesitle tamamlanabilirken, kayıt boyunca bütün nesneleri saymak zaman çizelgesinin daha büyük bölümünü incelemeyi gerektirebilir.

  • Kısa klip ve düşük ilk yanıt süresi: Statik modun sabit işlemesi daha uygun olabilir.
  • Uzun videoda belirli an, söz veya olay arama: Ajanlı modun seçici taraması daha az içerik yükleyebilir.
  • Zaman çizelgesinin düzenli kapsanması gereken kontrol: Statik örnekleme daha öngörülebilir olsa da gerekli ayrıntıya göre kare hızı ayrıca ayarlanmalıdır.
  • Hızlı hareket veya kısa anomali: Ajanlı mod, şüpheli aralığı farklı kare hızı ve çözünürlükle yeniden inceleyebilir.

Yüzde 88 daha az token, faturada aynı oranda indirim değil

Gemini 3.7 Flash’ın seçici video analizi, statik yönteme göre daha az içerik yüklerken azami tasarrufun garanti olmadığını gösteriyor.

Yüzde 88 değeri, statik işlemeye karşı ölçülen en yüksek token azalmasını ifade ediyor. Yüzde 66 ise ayrı bir ölçüt olan analiz maliyetindeki azami düşüş. İki oranın farklı olması önemli: ajanlı sistem daha az video içeriği yükleyebilse de zaman çizelgesinde gezinmek için akıl yürütüyor ve dahili video araçlarını kullanıyor.

N‑gram’ın teknik değerlendirmesi, açıklanan yüzdelerin garanti değil benchmark tavanları olduğunu; gerçek tüketimin videonun yapısına, sorguya, modele ve incelenen aralıklarla veri türlerine göre değişeceğini vurguluyor. Dolayısıyla yüzde 88 daha az token, her iş yükünde yüzde 88 daha düşük toplam fatura anlamına gelmiyor.

Dar bir sorunun yanıtı uzun kaydın tek bir bölümündeyse tasarrufun büyümesi beklenebilir. Buna karşılık geniş kapsamlı özetleme, kayıt boyunca sayım veya sürekli hareket takibi gibi görevlerde model daha fazla aralık açabilir. Ajanlı mod ayrıca kısa videolarda dahili gezinme ve araç çağrıları nedeniyle ilk token süresini bir miktar artırabilir.

Token tüketimi ile analiz kalitesi de birlikte değerlendirilmeli. Lansman ölçümlerinde uzun video içeriğinde kalite artışı yüzde 7’ye kadar çıktı; bu da açıklanan en yüksek sonuçlardan biri. Seçici taramanın kritik olayı bulamadığı bir sorguda düşük tüketim tek başına verim kazanımı sayılmaz.

Destek kapsamı genişledi, sonuçlar hâlâ iş yüküne bağlı

Ajanlı işlemeyi etkinleştirmek için video girdisinin processing seçeneği “agentic” olarak ayarlanıyor; seçenek verilmezse statik yöntem kullanılıyor. Özellik için ayrı bir ek ücret açıklanmadı ve standart Gemini API token fiyatlandırması geçerli. Olası maliyet avantajı daha ucuz birim fiyattan değil, modelin daha az içerik yüklemesinden kaynaklanıyor.

Gemini 3.8 Flash’ın destek listesine girmesi, yüzde 88 sonucunun bu modelde ölçüldüğü anlamına gelmiyor. Lansmandaki azami token azalması özellikle Gemini 3.7 Flash ölçümüyle ilişkilendirildi. Desteklenen diğer modellerin tüketimi ve doğruluğu, aynı video ve sorguda farklılaşabilir.

Şu anda doğrulanan sınır bu: özellik Gemini API’de yayımlandı, statik 1 FPS’den farklı olarak videoda gerekli kanıtı dinamik biçimde seçiyor ve Google’ın testlerinde token kullanımını yüzde 88’e kadar azalttı. Farklı süreleri, modelleri ve görev türlerini aynı koşullarda karşılaştıran bağımsız sonuçlar sınırlı olduğundan bu oran, her API çağrısının beklenen sonucu değil, açıklanmış azami verim kazanımı olarak okunmalı.

Ayrıca okuyun:

Paylaş:

Bültenimize abone olun

En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.

0