رونویسی زندهٔ Microsoft رکورد زد؛ اما هنوز برای تولید آماده نیست

|نویسنده: تیم تحریریه QUASA|5 دقیقه مطالعه| 1
رونویسی زندهٔ Microsoft رکورد زد؛ اما هنوز برای تولید آماده نیست

مایکروسافت در معرفی ۱ اکتبر ۲۰۲۶ مدل MAI-Transcribe-2-Streaming اعلام کرد که این مدل در ارزیابی رونویسی زندهٔ Artificial Analysis از نظر دقت متن موقت و نهایی رتبهٔ نخست را گرفته است. مدل، گفتار را هنگام صحبت‌کردن به متن تبدیل می‌کند، از ۶۰ زبان پشتیبانی می‌کند و قیمت مقدماتی آن تا پایان ۲۰۲۶، ۰٫۵۴ دلار برای هر ساعت صوت است. این نتیجه برای سازندگان زیرنویس و عامل صوتی قابل توجه است، اما رتبهٔ دقت دربارهٔ تعهد عملیاتی سرویس چیزی نمی‌گوید.

راهنمای Azure برای اتصال بلادرنگ وضعیت فعلی مدل را پیش‌نمایش عمومی، بدون توافق‌نامهٔ سطح خدمات یا SLA و ناموصی برای بار کاری تولیدی توصیف می‌کند. توسعه‌دهندگان می‌توانند جریان صوت را از طریق Realtime API به مدل بفرستند و متن‌های موقت و نهایی بگیرند؛ راه اتصال از طریق Azure Speech SDK نیز معرفی شده است. بنابراین امکان ساخت و آزمودن یک نمونه وجود دارد، اما اتکای محصول زنده به دسترس‌پذیری تضمین‌شده با شرایط فعلی سرویس سازگار نیست.

دقت، تأخیر، قیمت و وضعیت سرویس در یک نگاه

تحلیل مستقل نتایج AA-WER برای رونوشت نهایی MAI-Transcribe-2-Streaming نرخ خطای واژهٔ ۲٫۵٪ و میانگین ۰٫۱۳ ثانیه تا دریافت متن نهایی پس از تشخیص پایان گفتار را گزارش می‌کند. در همان مقایسه، Grok Voice Transcribe 2.0 به ۲٫۷٪ خطای واژه و ۰٫۴۹ ثانیه رسید. این‌ها اندازه‌گیری‌های یک آزمون مشخص‌اند؛ قیمت و وضعیت پشتیبانی، بخش‌های جداگانهٔ تصمیم استقرار هستند.

  • دقت: خطای واژهٔ متن نهایی در AA-WER برابر ۲٫۵٪ است؛ این عدد دقت تضمین‌شده برای هر زبان یا هر محیط صوتی نیست.
  • تأخیر: ۰٫۱۳ ثانیه فاصلهٔ میان تشخیص پایان گفتار و دریافت متن نهایی در آزمون است، نه کل زمانی که کاربر برای دیدن زیرنویس منتظر می‌ماند.
  • هزینه: قیمت مقدماتی ۰٫۵۴ دلار به ازای هر ساعت صوت تا پایان ۲۰۲۶ اعلام شده است؛ نرخ دورهٔ بعد در این اعلام مشخص نشده است.
  • تعهد سرویس: مدل در پیش‌نمایش عمومی قرار دارد، SLA ندارد و برای بار کاری تولیدی توصیه نمی‌شود.

این چهار شاخص به پرسش‌های متفاوتی پاسخ می‌دهند. نرخ خطا می‌گوید خروجی آزمون چقدر به متن مرجع نزدیک بوده، تأخیر زمان پایان‌یافتن یک بخش از پردازش را نشان می‌دهد، قیمت مبنای محاسبهٔ مصرف صوت است و SLA به تعهد رسمی ارائهٔ سرویس مربوط می‌شود. برتری در شاخص نخست، جای خالی شاخص آخر را پر نمی‌کند.

رتبهٔ نخست در بنچمارک چه معنایی دارد؟

نرخ خطای واژه، واژه‌های حذف‌شده، جایگزین‌شده و افزوده‌شده را نسبت به متن مرجع می‌سنجد. مزیت رتبه‌بندی آن است که مدل‌ها روی یک مجموعه و با روشی مشترک مقایسه می‌شوند. همین ویژگی حد آن را نیز روشن می‌کند: کیفیت صدای تماس تلفنی، نام‌های خاص، اصطلاحات یک درس یا گفتار آمیختهٔ فارسی و انگلیسی ممکن است با صدای مجموعهٔ آزمون فرق داشته باشد.

دادهٔ AA-WER Streaming عمدتاً بر گفتار انگلیسی تکیه دارد و نتیجهٔ جداگانه‌ای برای فارسی در این عدد دیده نمی‌شود. پشتیبانی از یک زبان یعنی مدل برای دریافت آن زبان عرضه شده است؛ به معنای ثبت همان نرخ خطا برای فارسی ایران، دری یا لهجه‌های دیگر نیست. برای تیمی که زیرنویس فارسی می‌سازد، تفاوت میان «زبان پشتیبانی‌شده» و «دقت اندازه‌گیری‌شده در همان زبان» تعیین‌کننده است.

زمان ۰٫۱۳ ثانیه نیز از آغاز صحبت‌کردن محاسبه نمی‌شود. نقطهٔ شروع آن تشخیص پایان گفتار در روش آزمون است و نتیجهٔ نهایی پس از آن ثبت می‌شود. در محصول واقعی، دریافت صدا، شبکه، تشخیص مرز گفتار و نمایش متن هم بر زمان قابل مشاهده اثر می‌گذارند؛ به همین دلیل نمی‌توان عدد بنچمارک را به‌تنهایی به‌عنوان تأخیر زیرنویس روی صفحه یا سرعت پاسخ کامل یک عامل صوتی خواند.

متن موقت چه کمکی به زیرنویس و عامل صوتی می‌کند؟

ویژگی جریانی مدل این است که پیش از تمام‌شدن صحبت، فرضیه‌هایی از متن را برمی‌گرداند و با رسیدن صدای بیشتر آن‌ها را اصلاح می‌کند. در زیرنویس زنده، این رفتار می‌تواند متن را زودتر در اختیار بیننده بگذارد. در عامل صوتی نیز سامانه می‌تواند پیش از دریافت رونوشت نهایی، بخشی از درخواست را پردازش کند؛ البته تصمیمی که بر پایهٔ متن موقت گرفته می‌شود باید احتمال تغییر واژه‌ها را در نظر داشته باشد.

متن موقت و متن نهایی نقش یکسانی ندارند. نمایش پیش‌نویس گفتار به کارشناس مرکز تماس با ثبت قطعی گفتهٔ مشتری تفاوت دارد؛ در زیرنویس هم اصلاح پی‌درپی واژه‌ها می‌تواند خواندن را دشوار کند، حتی اگر نخستین متن سریع ظاهر شود. این تفاوت از نحوهٔ کار رونویسی جریانی ناشی می‌شود و با یک عدد خطای نهایی به‌تنهایی سنجیده نمی‌شود.

Azure در فهرست زبان‌های قابل استفاده، فارسی را با کد fa آورده است. این برای ساخت نمونهٔ فارسی نقطهٔ شروع مشخصی فراهم می‌کند، ولی دربارهٔ عملکرد مدل روی تماس شلوغ، گفتار دری یا واژه‌های تخصصی یک محصول نتیجه‌ای منتشر نمی‌کند. آزمون با صدای متناسب با همان کاربرد می‌تواند دقت متن نهایی و میزان تغییر متن موقت را از هم جدا نشان دهد؛ این ارزیابی محصول است، نه نتیجه‌ای که از رتبهٔ عمومی بنچمارک به دست آمده باشد.

مرز آزمایش و استقرار تولیدی کجاست؟

قیمت مقدماتی، آزمایش را قابل برآورد می‌کند: مصرف صوت را می‌توان بر مبنای ساعت محاسبه کرد. هزینهٔ کامل یک عامل صوتی به رونویسی محدود نیست و پردازش درخواست، تولید پاسخ و زیرساخت ارتباطی نیز به معماری آن بستگی دارند. همچنین MAI-Transcribe-2 غیرجریانی محصول دیگری است؛ قیمت یا نتیجهٔ آزمون آن نباید به نسخهٔ جریانی نسبت داده شود.

برای نمونهٔ زیرنویس، ارزیابی داخلی مرکز تماس یا آزمایش عامل صوتی، اتصال به مدل و مشاهدهٔ رفتار آن با وضعیت پیش‌نمایش سازگار است. سرویسی که باید در پخش زنده یا تماس مشتری تعهد دسترس‌پذیری مشخص بدهد، با نبود SLA مسئلهٔ دیگری روبه‌روست: نتیجهٔ مطلوب بنچمارک نمی‌تواند زمان رفع اختلال، تداوم خدمت یا شرایط پشتیبانی را تضمین کند. پیش از اتکای عملیاتی، تغییر وضعیت عرضه و انتشار شرایط رسمی سرویس همان داده‌ای است که تیم‌ها باید منتظر آن بمانند.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0