
رونویسی زندهٔ Microsoft رکورد زد؛ اما هنوز برای تولید آماده نیست

مایکروسافت در معرفی ۱ اکتبر ۲۰۲۶ مدل MAI-Transcribe-2-Streaming اعلام کرد که این مدل در ارزیابی رونویسی زندهٔ Artificial Analysis از نظر دقت متن موقت و نهایی رتبهٔ نخست را گرفته است. مدل، گفتار را هنگام صحبتکردن به متن تبدیل میکند، از ۶۰ زبان پشتیبانی میکند و قیمت مقدماتی آن تا پایان ۲۰۲۶، ۰٫۵۴ دلار برای هر ساعت صوت است. این نتیجه برای سازندگان زیرنویس و عامل صوتی قابل توجه است، اما رتبهٔ دقت دربارهٔ تعهد عملیاتی سرویس چیزی نمیگوید.
راهنمای Azure برای اتصال بلادرنگ وضعیت فعلی مدل را پیشنمایش عمومی، بدون توافقنامهٔ سطح خدمات یا SLA و ناموصی برای بار کاری تولیدی توصیف میکند. توسعهدهندگان میتوانند جریان صوت را از طریق Realtime API به مدل بفرستند و متنهای موقت و نهایی بگیرند؛ راه اتصال از طریق Azure Speech SDK نیز معرفی شده است. بنابراین امکان ساخت و آزمودن یک نمونه وجود دارد، اما اتکای محصول زنده به دسترسپذیری تضمینشده با شرایط فعلی سرویس سازگار نیست.
دقت، تأخیر، قیمت و وضعیت سرویس در یک نگاه
تحلیل مستقل نتایج AA-WER برای رونوشت نهایی MAI-Transcribe-2-Streaming نرخ خطای واژهٔ ۲٫۵٪ و میانگین ۰٫۱۳ ثانیه تا دریافت متن نهایی پس از تشخیص پایان گفتار را گزارش میکند. در همان مقایسه، Grok Voice Transcribe 2.0 به ۲٫۷٪ خطای واژه و ۰٫۴۹ ثانیه رسید. اینها اندازهگیریهای یک آزمون مشخصاند؛ قیمت و وضعیت پشتیبانی، بخشهای جداگانهٔ تصمیم استقرار هستند.
- دقت: خطای واژهٔ متن نهایی در AA-WER برابر ۲٫۵٪ است؛ این عدد دقت تضمینشده برای هر زبان یا هر محیط صوتی نیست.
- تأخیر: ۰٫۱۳ ثانیه فاصلهٔ میان تشخیص پایان گفتار و دریافت متن نهایی در آزمون است، نه کل زمانی که کاربر برای دیدن زیرنویس منتظر میماند.
- هزینه: قیمت مقدماتی ۰٫۵۴ دلار به ازای هر ساعت صوت تا پایان ۲۰۲۶ اعلام شده است؛ نرخ دورهٔ بعد در این اعلام مشخص نشده است.
- تعهد سرویس: مدل در پیشنمایش عمومی قرار دارد، SLA ندارد و برای بار کاری تولیدی توصیه نمیشود.
این چهار شاخص به پرسشهای متفاوتی پاسخ میدهند. نرخ خطا میگوید خروجی آزمون چقدر به متن مرجع نزدیک بوده، تأخیر زمان پایانیافتن یک بخش از پردازش را نشان میدهد، قیمت مبنای محاسبهٔ مصرف صوت است و SLA به تعهد رسمی ارائهٔ سرویس مربوط میشود. برتری در شاخص نخست، جای خالی شاخص آخر را پر نمیکند.
رتبهٔ نخست در بنچمارک چه معنایی دارد؟
نرخ خطای واژه، واژههای حذفشده، جایگزینشده و افزودهشده را نسبت به متن مرجع میسنجد. مزیت رتبهبندی آن است که مدلها روی یک مجموعه و با روشی مشترک مقایسه میشوند. همین ویژگی حد آن را نیز روشن میکند: کیفیت صدای تماس تلفنی، نامهای خاص، اصطلاحات یک درس یا گفتار آمیختهٔ فارسی و انگلیسی ممکن است با صدای مجموعهٔ آزمون فرق داشته باشد.
دادهٔ AA-WER Streaming عمدتاً بر گفتار انگلیسی تکیه دارد و نتیجهٔ جداگانهای برای فارسی در این عدد دیده نمیشود. پشتیبانی از یک زبان یعنی مدل برای دریافت آن زبان عرضه شده است؛ به معنای ثبت همان نرخ خطا برای فارسی ایران، دری یا لهجههای دیگر نیست. برای تیمی که زیرنویس فارسی میسازد، تفاوت میان «زبان پشتیبانیشده» و «دقت اندازهگیریشده در همان زبان» تعیینکننده است.
زمان ۰٫۱۳ ثانیه نیز از آغاز صحبتکردن محاسبه نمیشود. نقطهٔ شروع آن تشخیص پایان گفتار در روش آزمون است و نتیجهٔ نهایی پس از آن ثبت میشود. در محصول واقعی، دریافت صدا، شبکه، تشخیص مرز گفتار و نمایش متن هم بر زمان قابل مشاهده اثر میگذارند؛ به همین دلیل نمیتوان عدد بنچمارک را بهتنهایی بهعنوان تأخیر زیرنویس روی صفحه یا سرعت پاسخ کامل یک عامل صوتی خواند.
متن موقت چه کمکی به زیرنویس و عامل صوتی میکند؟
ویژگی جریانی مدل این است که پیش از تمامشدن صحبت، فرضیههایی از متن را برمیگرداند و با رسیدن صدای بیشتر آنها را اصلاح میکند. در زیرنویس زنده، این رفتار میتواند متن را زودتر در اختیار بیننده بگذارد. در عامل صوتی نیز سامانه میتواند پیش از دریافت رونوشت نهایی، بخشی از درخواست را پردازش کند؛ البته تصمیمی که بر پایهٔ متن موقت گرفته میشود باید احتمال تغییر واژهها را در نظر داشته باشد.
متن موقت و متن نهایی نقش یکسانی ندارند. نمایش پیشنویس گفتار به کارشناس مرکز تماس با ثبت قطعی گفتهٔ مشتری تفاوت دارد؛ در زیرنویس هم اصلاح پیدرپی واژهها میتواند خواندن را دشوار کند، حتی اگر نخستین متن سریع ظاهر شود. این تفاوت از نحوهٔ کار رونویسی جریانی ناشی میشود و با یک عدد خطای نهایی بهتنهایی سنجیده نمیشود.
Azure در فهرست زبانهای قابل استفاده، فارسی را با کد fa آورده است. این برای ساخت نمونهٔ فارسی نقطهٔ شروع مشخصی فراهم میکند، ولی دربارهٔ عملکرد مدل روی تماس شلوغ، گفتار دری یا واژههای تخصصی یک محصول نتیجهای منتشر نمیکند. آزمون با صدای متناسب با همان کاربرد میتواند دقت متن نهایی و میزان تغییر متن موقت را از هم جدا نشان دهد؛ این ارزیابی محصول است، نه نتیجهای که از رتبهٔ عمومی بنچمارک به دست آمده باشد.
مرز آزمایش و استقرار تولیدی کجاست؟
قیمت مقدماتی، آزمایش را قابل برآورد میکند: مصرف صوت را میتوان بر مبنای ساعت محاسبه کرد. هزینهٔ کامل یک عامل صوتی به رونویسی محدود نیست و پردازش درخواست، تولید پاسخ و زیرساخت ارتباطی نیز به معماری آن بستگی دارند. همچنین MAI-Transcribe-2 غیرجریانی محصول دیگری است؛ قیمت یا نتیجهٔ آزمون آن نباید به نسخهٔ جریانی نسبت داده شود.
برای نمونهٔ زیرنویس، ارزیابی داخلی مرکز تماس یا آزمایش عامل صوتی، اتصال به مدل و مشاهدهٔ رفتار آن با وضعیت پیشنمایش سازگار است. سرویسی که باید در پخش زنده یا تماس مشتری تعهد دسترسپذیری مشخص بدهد، با نبود SLA مسئلهٔ دیگری روبهروست: نتیجهٔ مطلوب بنچمارک نمیتواند زمان رفع اختلال، تداوم خدمت یا شرایط پشتیبانی را تضمین کند. پیش از اتکای عملیاتی، تغییر وضعیت عرضه و انتشار شرایط رسمی سرویس همان دادهای است که تیمها باید منتظر آن بمانند.
بیشتر بخوانید:
مقالات مرتبط


اتحادیهٔ اروپا به دیتاسنترها برچسب میزند؛ نخستین رتبهها در ۲۰۲۷

GKE Agent Sandbox عمومی شد؛ آغاز محیط تا ۴۵ برابر سریعتر است

Microsoft: هوش مصنوعی زمان بعضی حملات سایبری را به ثانیه رسانده است

دسترسی YouTube را بدون رمز بدهید؛ Editor Limited درآمد را پنهان میکند

SQLite یا PostgreSQL؛ یک نویسنده سریع است، ۱۶ نویسنده برنده را عوض میکنند
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.