
Modulate-მა $25 მილიონი მოიზიდა — ხმა უკვე თვეში 10 მილიონ საათს ამუშავებს

ბოსტონში დაფუძნებულმა Modulate-მა, როგორც მის 2026 წლის 28 სექტემბრის განცხადებაში წერია, Future Ventures-ის ხელმძღვანელობით $25 მილიონი მოიზიდა, Hyperplane-ისა და Lakestar-ის მონაწილეობით; ჯამურმა დაფინანსებამ $60 მილიონს მიაღწია, ხოლო კომპანია აცხადებს, რომ მისი მოდელები უკვე თვეში 10 მილიონ საათზე მეტ აუდიოს ამუშავებს და მთლიანობაში დამუშავებულმა მოცულობამ 600 მილიონ საათს გადააჭარბა. თანხა ხმოვანი მოდელების განვითარებასა და დეველოპერებისთვის მათი მიწოდების გაფართოებას მოხმარდება.
SiliconANGLE-ის ცნობით, Modulate-ის Velma საუბრის უშუალო აუდიოში ტონს, ემოციას, განზრახვასა და სინთეზური ხმის ნიშნებს ეძებს; მის საფუძველში 100-ზე მეტი სპეციალიზებული მოდელია, ხოლო ცალკე ტრანსკრიფციის API-ით პაკეტური დამუშავება საათში $0.03 ღირს. ამ მიდგომით კომპანიას სურს, თაღლითობისა და ხმოვანი AI აგენტების შეცდომების აღმოჩენა სხვა კომპანიების პროდუქტებში ჩაშენებად სერვისად აქციოს. ახალი SDK-ები, API-ები და ინტეგრაციები გაფართოების გეგმის ნაწილია.
რა იყიდება ჩვეულებრივი ტრანსკრიფციის მიღმა
ტრანსკრიფცია საუბრის სიტყვიერ შინაარსს ინახავს. Velma ამ შინაარსს იმ ნიშნებთან აკავშირებს, რომლებიც მხოლოდ ჩანაწერში ისმის: ხმის ინტონაციასთან, ემოციურ ცვლილებასთან, აქცენტთან და მეტყველების სინთეზურობის შესაძლო კვალთან. ამ ნიშნების დამოუკიდებლად გამოყენებაც შეიძლება და მათი გაერთიანებაც უფრო რთული მოვლენის შესაფასებლად, მაგალითად მაშინ, როცა ზარის მონაწილე თავს სხვა ადამიანად ასაღებს ან მომხმარებელი ავტომატურ აგენტთან საუბარში უკმაყოფილებას ავლენს.
პროდუქტის კომერციული აზრი სწორედ ამ განსხვავებაშია. თუ ორგანიზაციას მხოლოდ საუბრის ტექსტი სჭირდება, მისთვის ტრანსკრიფციის სერვისი საკმარისი შეიძლება იყოს. თაღლითობის ან მომსახურების ხარისხის შეფასებისას კი სიტყვები ხშირად ყველა საჭირო მინიშნებას არ იძლევა: ერთსა და იმავე წინადადებას განსხვავებული ტონი შეიძლება ჰქონდეს, ხოლო ხმის დამაჯერებელი შინაარსი მის სინთეზურ წარმოშობას ვერ გამორიცხავს. ამიტომ Modulate აუდიოსგან მიღებულ სიგნალებს დამოუკიდებელ პროგრამულ ფენად სთავაზობს.
Velma-ს არქიტექტურა ერთი უნივერსალური მოდელის ნაცვლად სპეციალიზებულ მოდელებს არჩევს და მათ შედეგებს აერთიანებს. მაგალითად, ცალკე შეიძლება შეფასდეს მეტყველების ბუნებრივობა, მოსაუბრის ემოციური ტონი და საუბრის სავარაუდო განზრახვა, შემდეგ კი ეს ნიშნები კონკრეტული რისკის ამოცნობას დაეხმაროს. ასეთი პასუხი შესაძლებელია ზარის მიმდინარეობის დროსაც. გაფრთხილების შემდეგ მოქმედება უკვე იმ ორგანიზაციის წესებზეა დამოკიდებული, რომლის მომსახურებაშიც სისტემა მუშაობს.
სათამაშო ჩატიდან ზარების უსაფრთხოებამდე
The Next Web-ის მასალაში აღწერილია Modulate-ის წინა ბაზარი: ToxMod 2023 წლიდან Call of Duty-ის ხმოვანი ჩატის მოდერაციაში გამოიყენება, ხოლო Lakestar-მა 2022 წელს კომპანიის $30-მილიონიან A სერიის რაუნდს უხელმძღვანელა; იმავე მასალაში თანადამფუძნებელი და აღმასრულებელი დირექტორი კარტერ ჰაფმანი ამბობს: „Voice is becoming a primary interface for AI“. თამაშებში მუშაობამ კომპანიას ხმაურიან, ერთმანეთში გადაფარულ და ემოციურად დატვირთულ საუბრებთან მუშაობის გამოცდილება მისცა.
სოციალურ და სათამაშო პლატფორმებზე ამოცანა შეიძლება იყოს შევიწროების ან არასრულწლოვანთან სახიფათო კონტაქტის ნიშნების აღმოჩენა. სატელეფონო მომსახურებაში ყურადღება სხვა რისკზე გადადის: რამდენად ჰგავს ზარის მონაწილე სინთეზურ ხმას და ცდილობს თუ არა ვინმეს განსახიერებას. ჯანდაცვის დაწესებულებები კომპანიის მიერ დასახელებული გამოყენების ერთ-ერთი სფეროა. ასეთ ზარებში სიგნალის დროულად მიღებას მნიშვნელობა აქვს, რადგან საუბრის დასრულების შემდეგ აღმოჩენილი საეჭვო ეპიზოდი ოპერატორს მიმდინარე გადაწყვეტილებაში ვეღარ დაეხმარება.
კიდევ ერთი მიმართულებაა ხმოვანი AI აგენტების ზედამხედველობა. ავტომატურმა მოსაუბრემ შეიძლება ვერ გაიგოს მომხმარებლის თხოვნა, ვერ შეამჩნიოს უკმაყოფილება ან მომსახურების წესს გადაუხვიოს. აუდიოს ანალიზი ორგანიზაციას ასეთი მომენტების გამორჩევაში ეხმარება და აძლევს მას საფუძველს, გადაწყვიტოს, საჭიროა თუ არა ადამიანის ჩართვა ან საუბრის შემდგომი შეფასება. სხვადასხვა გამოყენებისთვის ერთი და იგივე სიგნალების მნიშვნელობა განსხვავდება.
როგორ უნდა იმუშაოს ახალმა კაპიტალმა
დაფინანსება Modulate-ის კვლევაზე, პროდუქტისა და ინჟინერიის გუნდებზე, დეველოპერებთან მუშაობასა და პარტნიორობაზე ნაწილდება. დაგეგმილია დამატებითი დარგობრივი მოდელები, პროგრამული განვითარების ნაკრებები და განთავსების ვარიანტები. ამ ცვლილებების ეკონომიკური მიზანია, ხმოვან სერვისებს აუდიოს ანალიზის ჩაშენება საკუთარი სპეციალიზებული მოდელების გაწვრთნის გარეშე შეეძლოთ. ერთი ტექნოლოგიური საფუძველი სხვადასხვა კლიენტის პროგრამულ სისტემაში შეიძლება გამოიყენონ.
დეველოპერისთვის გაყიდვადი ნაწილი მხოლოდ ტექსტი ან საბოლოო გაფრთხილება არ არის. წვდომა ეხება უფრო წვრილ ნიშნებსაც, რომელთა საფუძველზე კლიენტი საკუთარ წესებს ადგენს: ერთმა კომპანიამ შეიძლება სინთეზური ხმის გამოვლენას მიანიჭოს უპირატესობა, მეორემ — მომხმარებლის უკმაყოფილების ან აგენტის ქცევის შეფასებას. ამიტომ გაფართოებული API-ები ბიზნესმოდელის ცენტრში დგას. ისინი პროდუქტის გამოყენებას კლიენტის კონკრეტულ ამოცანას უკავშირებს, ხოლო პარტნიორული ინტეგრაციები მისი გავრცელების გზებს ზრდის.
კაპიტალის მოზიდვა თავისთავად არ ნიშნავს, რომ დაგეგმილი ხელსაწყოები უკვე ხელმისაწვდომია. ნაწილს ჯერ განვითარება და სხვადასხვა პროგრამულ გარემოში გამოცდა სჭირდება. სატელეფონო თაღლითობის ამოცნობა, სოციალური პლატფორმის მოდერაცია და აგენტის მუშაობის შეფასება ერთნაირ სიზუსტესა და რეაგირების წესს არ მოითხოვს. პროდუქტის გაფართოების წარმატებას განსაზღვრავს, რამდენად გამოსადეგი იქნება თითოეული სიგნალი შესაბამის გარემოში და რამდენად მარტივად შეძლებს კლიენტი მის გამოყენებას.
რას გვიჩვენებს აუდიოს მოცულობა
დამუშავებული აუდიოს რაოდენობა Modulate-ის სისტემების მასშტაბზე მიუთითებს, მაგრამ გაყიდვების პირდაპირ საზომად ვერ გამოდგება. ერთი და იგივე საათობრივი მაჩვენებელი შეიძლება სხვადასხვა პროდუქტს, კონტრაქტს ან მომხმარებელს უკავშირდებოდეს. გამოქვეყნებული მონაცემებით ვერ განისაზღვრება, რამდენი გადამხდელი კლიენტია, რა წილია განმეორებითი გამოყენება და როგორ ნაწილდება მოცულობა თაღლითობის აღმოჩენას, თამაშების მოდერაციასა და სხვა მომსახურებებს შორის. ეს კითხვები განსაკუთრებით მნიშვნელოვანია კომპანიისთვის, რომელიც დეველოპერებზე ორიენტირებულ შეთავაზებას აფართოებს.
სიზუსტეზეც ამოცანის შესაბამისი საზომია საჭირო. სინთეზური ხმის ამოცნობის საჯარო ტესტში მიღებული შედეგი ვერ აღწერს ავტომატურად, რამდენად კარგად განასხვავებს მოდელი უკმაყოფილებას რეალურ მომხმარებელთან საუბარში. შეცდომის ფასი განსხვავებულია: თაღლითური ზარის გამორჩენა უსაფრთხოების რისკს ქმნის, ზედმეტმა განგაშმა კი შეიძლება ნამდვილი მომხმარებლის მომსახურება შეაფერხოს. შედარებისთვის საჭიროა შეფასების მონაცემები, დადებითი შემთხვევის განსაზღვრება და მცდარი განგაშების სიხშირე სწორედ იმ გარემოში, სადაც სისტემა უნდა გამოიყენონ.
ახალი რაუნდის შემდეგ ყურადღება დეველოპერულ წვდომასა და რეალურ ინტეგრაციებზე გადავა. დაგეგმილი ხელსაწყოების ხელმისაწვდომობა და სხვადასხვა გამოყენების შედეგების გამოქვეყნება აჩვენებს, რამდენად გადაიქცევა აუდიოს დამუშავების დიდი მოცულობა კლიენტისთვის საიმედო გაფრთხილებად და განმეორებად ბიზნესად.
ასევე წაიკითხეთ:
მსგავსი სტატიები


Descript თუ CapCut: ტექსტური მონტაჟი Shorts-ის ტემპს ვერ ანაცვლებს

Otter თუ Fireflies: ბოტის ქცევა ფუნქციებზე მნიშვნელოვანი აღმოჩნდა

General Intuition-მა $220 მლნ მოიზიდა — თამაშის მონაცემები $6,2 მლრდ-ად ფასობს

Fleuret AI-მ €4 მლნ მოიზიდა — პენტესტი ერთჯერადი აუდიტი აღარ იქნება

CrewAI თუ AutoGen: აგენტების როლები თუ საუბრის მოქნილი მარშრუტი
გამოიწერეთ ჩვენი ბიულეტენი
მიიღეთ უახლესი ამბები Web3-ის, AI-სა და კრიპტოს შესახებ პირდაპირ თქვენს ელფოსტაზე.