Yapay Zekâ ve Otomasyon

Alma sesli ajanlarda 182 ms iddia ediyor; test sağlayıcının kendi ölçümü

|Yazar: QUASA Editör Ekibi|5 dk okuma
Alma sesli ajanlarda 182 ms iddia ediyor; test sağlayıcının kendi ölçümü

Phonely, telefon görüşmeleri için geliştirdiği Alma büyük dil modelini 1 Eylül 2026’da dış geliştiricilerin kullanımına açtı. SiliconANGLE’ın lansman haberi, modelin kullanıma sunulduğunu ve Phonely’nin ilk token için 182 ms bildirdiğini aktarıyor.

Alma’nın hedefi genel amaçlı bir yapay zekâ asistanının yerini almak değil; randevu, yönlendirme ve işlev çağırma gibi tanımlı telefon akışlarını daha kısa yanıt başlangıçlarıyla yürütmek. Ancak 182 ms değeri bağımsız bir test sonucu değil, Phonely’nin kendi altyapısı ve yöntemiyle elde ettiği ölçüm; 4 Eylül’de yayımlanan yönetici röportajı da yeni bir çıkış tarihinden çok ürünün bu konumlandırmasını ayrıntılandırıyor.

182 ms, uçtan uca konuşma gecikmesi değil

Phonely’nin Alma, GPT-4.1 ve GPT-5.6 için yürüttüğü ilk-token gecikme karşılaştırması

Başlıktaki 182 ms, modelin ilk boş olmayan metin tokenını üretmesine kadar geçen süreyi ifade ediyor. Arayanın sesinin yazıya çevrilmesi, ağ aktarımı, yanıt metninin sese dönüştürülmesi ve telefon altyapısındaki işlemler bu model ölçümüne ayrıca gecikme ekleyebilir. Bu nedenle değer, kişinin konuşmayı bitirmesiyle yapay sesin duyulması arasındaki toplam süre olarak okunamaz.

Phonely’nin ürün ve benchmark sayfasına göre ölçüm 21 Ağustos 2026’da AWS us-east-1 bölgesindeki bir istemciden her modele art arda 200 akış isteği gönderilerek yapıldı, beş ısınma isteği dışarıda bırakıldı ve Alma için 182 ms medyan ilk-token, 206 ms p99 ile 379 ms medyan tam-yanıt süresi elde edildi; aynı sayfa kalite değerlendirmesinde 200 ayrılmış çağrı dökümü, bütün modeller için aynı istemler ve puanlama yöntemi kullanıldığını, karma bir milyon giriş-çıkış tokenı başına karşılaştırmalı maliyetin 0,55 dolar olduğunu belirtiyor.

Yöntemin yayımlanması sonuçların hangi koşullarda üretildiğini görmeyi sağlıyor, fakat karşılaştırmayı bağımsız hale getirmiyor. Alma şirketin üretim dağıtımında aynı bölgede çalıştırılırken karşılaştırılan OpenAI modellerine açık internet üzerinden erişildi; istekler eşzamanlı değil sıralı gönderildi. Dolayısıyla sonuç, yalnızca model ağırlıklarını değil barındırma biçimini, ağ yolunu ve kapasite tahsisini de karşılaştırıyor.

Alma’nın uygun olduğu çağrılar dar ve tanımlı

Alma; randevu oluşturma ve değiştirme, rutin müşteri sorularını yanıtlama, çağrı yönlendirme, potansiyel müşteri nitelendirme, tahsilat senaryoları ve sistem sorgusu ya da aktarım gerektiren işlev çağrıları için konumlandırılıyor. Bu görevlerde görüşmenin adımları, toplanacak alanlar ve başarı koşulları önceden tanımlanabiliyor.

Uzmanlaşmanın odağı yalnızca konuşma diline benzeyen kısa yanıtlar değil. Modelin bir çağrı akışındaki adımları izlemesi, araya girmeleri yönetmesi ve doğru noktada takvim, kayıt sorgusu, DTMF veya aktarım işlevini çağırması bekleniyor. Bunlar, serbest biçimli sohbetten daha tekrarlanabilir ve ölçülebilir görevler.

Ürün sayfası Alma’yı açık uçlu çoklu ajan iş akışları, çok sayıda araç içeren uzun vadeli planlama, yaratıcı yazma, kodlama ve genel sohbet için uygun göstermiyor. Belirsiz hedeflerle araştırma ve bağımsız karar zinciri gerektiren bir sistemde genel amaçlı model ayrı bir orkestrasyon katmanında tutulabilir; Alma’nın rolü ise telefon görüşmesini yürütmekle sınırlandırılabilir.

Genel amaçlı modellerden farkı görev dağılımında

Phonely’nin savına göre metin ağırlıklı eğitim, telefonda uzun açıklamalar, gereksiz tekrarlar ve konuşma sırasına uymayan yanıtlar üretebiliyor. Alma ise gerçek çağrı örneklerinden yararlanarak kısa konuşma sıraları, telefon görgüsü ve tanımlı iş mantığı üzerinde uzmanlaştırılıyor.

CEO ve kurucu ortak Will Bodewes, No Jitter’ın 4 Eylül tarihli röportajında Alma’nın daha küçük bir model olduğunu, şirketin modeli kendi donanımında çalıştırabildiğini ve mimaride konuşma, bilgi çıkarma, görev kontrolü ile orkestrasyonu farklı modeller arasında böldüklerini anlattı. Aynı röportaj, bu yapının tamamen deterministik olmadığını; uzman modellerin görev tamamlama olasılığını artırmak için birlikte kullanıldığını da açıkça ortaya koyuyor.

Bu ayrım, Alma’nın genel amaçlı modellerden her işte daha yetenekli olduğu anlamına gelmiyor. Şirketin performans iddiası, yapılandırılmış sesli görüşmeler ve kendi dağıtım koşullarıyla sınırlı; kodlama, geniş araştırma veya uzun ufuklu muhakeme için karşılaştırılabilir bir üstünlük gösterilmiyor.

Test, barındırma ve veri seçenekleri tek bakışta

Alma’nın şirket ağı içinde çalıştırılması ve görüşme saklama süresinin kurum tarafından belirlenmesi
  • Örneklem ve tarih: Gecikme deneyi 21 Ağustos’ta her model için sıralı isteklerle yürütüldü; ayrı kalite değerlendirmesi ayrılmış çağrı dökümlerine dayandı.
  • Testin sahibi: Tasarım, çalıştırma ve yayımlama Phonely’ye ait. Bağımsız laboratuvar doğrulaması sunulmadı.
  • Paylaşımlı hizmet: Kullandıkça ödemeli kapasite sağlanıyor; şirket yük altında kuyruk gecikmesinin artabileceğini belirtiyor.
  • Öncelikli hizmet: Rezerve kapasite, öncelikli yönlendirme ve destek taahhüdü içeriyor. Öne çıkarılan düşük gecikme değerleri bu seçenekle ilişkilendiriliyor.
  • Kendi ortamında barındırma: Model müşteri VPC’sine veya internetten yalıtılmış şirket içi ortama kurulabiliyor; lisans ve hacim fiyatı özel teklif gerektiriyor.
  • Veri saklama: Phonely, şirket içi kurulumda sesin kurum ağından çıkmadığını, müşteri görüşmelerinin model eğitiminde kullanılmadığını ve saklama süresinin kurum tarafından ayarlanabildiğini söylüyor.

Türkiye’de çağrı merkezi sistemi geliştiren ekipler için kritik ayrım, benchmark’taki dağıtımla satın alınacak hizmetin aynı olup olmadığı. Paylaşımlı kapasitenin yoğun trafik altındaki kuyruk davranışı, Türkiye’den seçilen bölgeye ağ gecikmesi ve konuşmayı yazıya ve yeniden sese çeviren bileşenler şirketin model benchmark’ında ölçülen sonuca dahil değil.

Bağımsız ve Türkçe üretim sonuçları hâlâ eksik

Alma artık dış geliştiricilere açık ve ürünün görev sınırları net: tekrarlanabilir çağrı akışlarına odaklanan, gerektiğinde genel amaçlı bir modelle birlikte kullanılabilecek uzman bir dil modeli. Şirket ayrıca benchmark yöntemini, kapasite seçeneklerini ve kendi ortamında barındırma seçeneğini yayımlamış durumda.

Buna karşılık yayımlanan materyaller, öne çıkarılan gecikmeyi farklı bölgelerde, eşzamanlı trafik altında ve bağımsız bir test ortamında yeniden üretmiyor. Türkçe görüşmelerde işlev çağrısı başarısı, Türkiye’ye yakın bir dağıtımdaki uçtan uca ses gecikmesi, yoğun çağrı trafiğindeki kuyruk davranışı ve şirket içi kurulumun toplam maliyeti de henüz açık karşılaştırmalı verilerle gösterilmiş değil. Alma’nın ürün tezi belirgin; 182 ms iddiasının daha geniş bir performans kanıtına dönüşmesi için sağlayıcı dışındaki üretim testleri gerekiyor.

Ayrıca okuyun:

Paylaş:

Bültenimize abone olun

En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.

0