Modulate 25 milyon dolar aldı: Sesli AI’da 100 küçük model öne çıkıyor

|Yazar: QUASA Editör Ekibi|5 dk okuma| 1
Modulate 25 milyon dolar aldı: Sesli AI’da 100 küçük model öne çıkıyor

Boston merkezli Modulate, 28 Eylül 2026 tarihli açıklamasında Future Ventures öncülüğünde, Hyperplane ve Lakestar’ın katılımıyla 25 milyon dolar topladığını bildirdi; şirket toplam finansmanını 60 milyon dolar, Velma platformundaki uzman model sayısını 100’ün üzerinde ve aylık işlenen ses hacmini 10 milyon saatin üzerinde veriyor.

TechCrunch’ın 28 Eylül 2026’da yayımladığı habere göre Velma 100’ü aşkın küçük model kullanıyor; kurucu ortak Carter Huffman hedefi “full nuance and full understanding of a conversation” sözleriyle tarif ederken şirketin 40–45 çalışanına gelecek aylarda 10 kişinin daha katılması planlanıyor. Yatırım, konuşmayı yazıya dökmenin ötesinde sesin nasıl söylendiğini ve görüşmede ne yaşandığını çözümlemeye çalışan platformun geliştirilmesine ayrılacak. Hedeflenen alıcılar, çağrı sırasında dolandırıcılık ve sentetik ses işaretlerini ayırt etmek, müşteri tepkisini anlamak ya da sesli yapay zekâ ajanlarının davranışını izlemek isteyen işletmeler.

Yatırımın ürüne ve ekibe etkisi

Yeni sermaye, ses odaklı model araştırmasına, ürün ve mühendislik çalışmalarına, geliştirici araçlarına ve iş ortaklıklarına yönlendirilecek. Modulate daha fazla API, SDK ve dağıtım seçeneği üzerinde çalışıyor; bunlar yatırım turuyla birlikte açıklanan planlar. Müşterinin kendi çağrı altyapısını kullanıp ayrı bir analiz katmanı ekleyebilmesi, şirketin ürün konumlandırmasında önemli bir yer tutuyor.

Yerinde ve cihaz üzerinde çalıştırma seçeneklerinin geliştirilmesi, özellikle ses kayıtlarını kendi ortamında tutmak isteyen kurumlar için dağıtım biçimini değiştirebilir. Sesin kurum dışına çıkmadan incelenebilmesi, gizlilik koşulları sıkı olan çağrı operasyonlarında satın alma kararını etkileyebilir. Bu seçeneklerin genişletilmesi henüz tamamlanmış bir dağıtımın ilanı değil; planın değeri, farklı kurumların altyapısında nasıl uygulanacağına bağlı.

Velma ses analizini neden uzman modellere ayırıyor?

Ensemble Listening Model mimarisi, ses işaretlerini çıkaran modellerle bu işaretleri yorumlayan modelleri bir araya getiriyor. İlk grupta konuşmanın tonu, duygu, dil ve sesin sentetik olup olmadığı gibi özellikler bulunuyor. İkinci grup, müşterinin ne istediği, konuşmanın bir kuralı ihlal edip etmediği veya bir dolandırıcılık girişimi içerip içermediği gibi sorulara odaklanıyor.

Bu ayrım ürünün farklı görevleri aynı büyük modelin tek çıktısına bağlamadan sunmasını sağlıyor. Yalnızca transkripsiyon isteyen uygulama ile canlı çağrıda sahte ses işareti arayan güvenlik sistemi aynı hesaplamayı istemiyor. Gereken modellerin seçilmesi işlem yükünü azaltabilir; gerçek maliyet, hangi sinyallerin birlikte istendiğine, çağrının süresine ve sonucun ne kadar hızlı gerektiğine bağlı.

Metne çevrilen görüşme aranabilir ve özetlenebilir hâle gelir, ancak konuşmadaki vurgu, duraksama ve sesin doğallığı metinden tek başına çıkarılamaz. Sesin kendisini inceleyen uzman modeller burada tamamlayıcı rol üstleniyor. Böyle bir mimari, yeni bir tespit yeteneğinin sisteme ayrı bileşen olarak eklenmesine de elverişli; fakat bu esneklik, her görevde otomatik olarak daha iyi doğruluk elde edildiği anlamına gelmiyor.

İşletmeler hangi kullanım için ödeme yapabilir?

Transkripsiyon, uzun görüşme arşivinde konuşulanları bulmayı ve temsilci ya da sesli ajanın söylediklerini incelemeyi kolaylaştırır. Niyet analizi ise sözcüklerle sesin taşıdığı işaretleri birlikte ele almayı hedefler. Müşterinin kibar bir tonda konuşup yine de hizmetten memnun kalmadığı durumda salt olumlu duygu etiketi, görüşmenin sonucunu yanlış yansıtabilir. Bu yüzden müşteri deneyimi tarafında ödeme gerekçesi, her konuşmayı elle dinlemeden memnuniyetsizliğin nedenini daha erken fark etmektir.

Güvenlik akışında iki ayrı karar vardır: sesin yapay üretilmiş olma olasılığı ve arayanın dolandırıcılık amacı taşıyıp taşımadığı. Sentetik ses işareti, yüksek riskli çağrıyı ek kimlik doğrulamaya yönlendirmek için kullanılabilir; tek başına kötü niyet kanıtı değildir. Dolandırıcılık analizi ise görüşmenin içeriği ve seyriyle ilgili başka göstergeler üretir. Bu ayrım, yanlış alarm yüzünden meşru müşteriyi engellememenin de parçasıdır.

Sesli yapay zekâ ajanlarını kullanan işletmeler için başka bir sorun, ajanın müşteriyi anlamadan görüşmeyi sürdürmesi veya uyulması gereken kurallardan sapmasıdır. Analiz katmanı, görüşme sürerken müdahale gerektiren anı işaretleyebilir ya da sonradan kalite incelemesine veri sağlayabilir. Canlı uyarıda düşük gecikme önem kazanırken, geriye dönük incelemede daha ayrıntılı değerlendirmeye zaman ayrılabilir; dolayısıyla aynı kurulum her iş akışına uymaz.

Sosyal platform ve oyunlardaki sesli konuşmalar için moderasyon da ayrı bir alım nedeni olabilir. Burada amaç müşteri memnuniyetini ölçmekten ziyade taciz, zararlı davranış veya kural ihlalini işaretlemektir. İnceleme ekibinin hangi kayda bakacağına karar vermesi ile konuşmayı otomatik durdurma kararı farklı risk düzeyleri taşır. Tespit çıktısının değeri, kurumun onu hangi karara bağladığıyla birlikte değerlendirilir.

Fiyat ve doğruluk rakamlarının sınırı

Modulate’ın 18 Mart 2026 tarihli Velma Transcribe duyurusuna göre transkripsiyonun ilan edilen fiyatı ses saati başına yaklaşık 0,03 dolar, dil kapsamı 70’in üzerinde ve AMI Meeting Corpus testindeki hata sayısı ElevenLabs’e kıyasla yüzde 40’tan fazla düşük. Bunlar şirketin yayımladığı fiyat ve test iddialarıdır; toplu işleme için açıklanan birim fiyat, başka analizleri içeren kullanımın toplam bedeli olarak okunmamalıdır.

AMI karşılaştırması, çok konuşmacılı toplantı kayıtlarında yazıya dökme performansını anlatıyor. Aynı sonuçtan dolandırıcılık, müşteri niyeti veya sentetik ses tespitinin doğruluğu çıkarılamaz. Toplu transkripsiyonun birim bedeli de canlı analiz, farklı uzman modellerin birlikte çalışması ve kurumun kendi doğrulama süreci eklendiğinde ortaya çıkacak toplam maliyetle aynı şey değildir.

Türkiye’de çağrı işleyen bir kurum için belirleyici soru, Türkçe konuşmada, farklı aksanlarda, hat gürültüsünde ve diller arasında geçişte hangi hataların oluştuğudur. Genel dil kapsamı, bu koşullarda niyet veya sahte ses tespitinin başarısını ölçmez. Kurumun gerçek kayıtlarına benzeyen verilerde yanlış alarm ve kaçırılan olay oranlarının ayrı ayrı görülmesi, yatırımın ürün tarafındaki ticari karşılığını belirleyecek daha somut eşik olacaktır.

Ayrıca okuyun:

Paylaş:

Bültenimize abone olun

En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.

0