স্টার্টআপ ও ব্যবসা

Muse Voice Transcribe কথার মাঝেই ভাষা বদল বোঝে—তবু বাংলা যাচাই হয়নি

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 1
Muse Voice Transcribe কথার মাঝেই ভাষা বদল বোঝে—তবু বাংলা যাচাই হয়নি

Meta ১ সেপ্টেম্বর ২০২৬ Muse Voice Transcribe প্রকাশ করেছে। Meta-র প্রযুক্তিগত পরিচিতি অনুযায়ী, Meta Superintelligence Labs-এর মডেলটি চলমান অডিও থেকে তাৎক্ষণিক প্রতিলিপি, বক্তা শনাক্তকরণ ও কথার শেষ নির্ধারণ করে; একই বাক্য বা পরপর বাক্যে ভাষা বদলও চিনতে পারে।

এই ১ সেপ্টেম্বরের প্রকাশে মডেলটির ৭০টির বেশি প্রশিক্ষণ-ভাষা এবং সেগুলোর মধ্যে ২৫টি extensively verified ভাষার কথা নিশ্চিত করা হয়েছে। তবে উন্মুক্ত launch page ও পর্যালোচিত স্বাধীন প্রতিবেদনগুলোতে বাংলার আলাদা পরীক্ষা, বাংলা–ইংরেজি code-switching নমুনা বা ভাষাভিত্তিক নির্ভুলতার ফল নেই। তাই বাংলায় কাজ করার সম্ভাবনা আর বাংলার জন্য যাচাইকৃত নির্ভরযোগ্যতা এক দাবি নয়।

একই প্রবাহে প্রতিলিপি, বক্তা ও কথার সীমানা

Muse Voice Transcribe চলমান কথোপকথন থেকে একই সঙ্গে প্রতিলিপি, বক্তার পালা ও কথার শেষ শনাক্ত করছে।

Muse Voice Transcribe শুধু একটি সম্পূর্ণ রেকর্ডিং শেষ হওয়ার পর সেটিকে লেখায় বদলায় না। অডিও আসার সময়ই এটি automatic speech recognition বা ASR চালায়, বক্তার পালা আলাদা করে এবং বক্তব্য কখন শুরু বা শেষ হচ্ছে তা চিহ্নিত করে। এক ঘণ্টার বেশি দীর্ঘ অডিও ও ২০টির বেশি বক্তার কথোপকথন সামলানোর ক্ষমতাও প্রকাশিত হয়েছে, আলাদা post-processing ছাড়াই।

মডেলটি অডিওকে ৮০ মিলিসেকেন্ডের খণ্ডে নেয়। প্রতিটি খণ্ডের পর এটি আরও অডিও শুনবে নাকি একটি text token দেবে, সেই সিদ্ধান্ত নেয়। কঠিন শব্দের আগে বেশি প্রসঙ্গ শোনা এবং সহজ শব্দ দ্রুত চূড়ান্ত করার ব্যবস্থাটির নাম adaptive delay; এর উদ্দেশ্য প্রতিটি শব্দে একই বিলম্ব চাপিয়ে না দিয়ে গতি ও নির্ভুলতার ভারসাম্য বদলানো।

Speaker diarization-এর জন্য বিশেষ token সম্ভাব্য বক্তা-বদল এবং সংশ্লিষ্ট বক্তাকে চিহ্নিত করে। Endpointing-এর আলাদা token কথার শুরু ও শেষ নির্দেশ করে। ফলে কোনো বৈঠকের প্রতিলিপিতে শুধু শব্দ নয়, কোন অংশটি কার এবং কখন নতুন বক্তব্য শুরু হয়েছে—সেটিও একই মডেলের output হতে পারে। তবে ২০টির বেশি বক্তা সমর্থনের অর্থ সব কক্ষ, মাইক্রোফোন বা একসঙ্গে কথা বলার পরিস্থিতিতে সমান নির্ভুলতা নয়।

৭০টির বেশি, ২৫টি ও পাঁচটি ভারতীয় ভাষার অর্থ আলাদা

Muse Voice Transcribe-এর প্রশিক্ষিত ৭০টির বেশি ভাষা, যাচাই করা ২৫টি ভাষা ও পাঁচটি নিশ্চিত ভারতীয় ভাষার পৃথক অবস্থান।

ভাষা-পরিধির সংখ্যাগুলো একই মানের নিশ্চয়তা দেয় না। Gadgets 360-এর ২ সেপ্টেম্বরের প্রতিবেদনে ৭০টির বেশি প্রশিক্ষণ-ভাষা ও প্রাথমিকভাবে extensively validated ২৫টি ভাষার পাশাপাশি হিন্দি, তামিল, তেলুগু, কন্নড় ও মালয়ালমকে পাঁচটি ভারতীয় ভাষা হিসেবে চিহ্নিত করা হয়েছে। বাংলা ওই প্রকাশ্যে নাম দেওয়া পাঁচটির মধ্যে নেই।

  • প্রশিক্ষিত ভাষা: ৭০টির বেশি ভাষার অডিও মডেল তৈরির প্রশিক্ষণ-পরিসরে ব্যবহৃত হয়েছে। এতে প্রতিটি ভাষায় সমান ফল প্রমাণিত হয় না।
  • Extensively verified ভাষা: প্রাথমিক প্রকাশে ২৫টি ভাষাকে এই অপেক্ষাকৃত শক্তিশালী মর্যাদা দেওয়া হয়েছে। তবু এটি সব উচ্চারণ, অডিও পরিবেশ ও ভাষাজোড়ায় অভিন্ন ফলের নিশ্চয়তা নয়।
  • প্রকাশ্যে চিহ্নিত ভারতীয় ভাষা: হিন্দি, তামিল, তেলুগু, কন্নড় ও মালয়ালম। এটি ২৫টি ভাষার পূর্ণ তালিকা নয়, বরং আঞ্চলিক launch coverage-এ নিশ্চিত করা পাঁচটি নাম।
  • বাংলার প্রমাণ: পর্যালোচিত উন্মুক্ত পাতাগুলোতে বাংলা-কেন্দ্রিক benchmark, নমুনা কিংবা word error rate প্রকাশিত হয়নি।

“Trained”, “supported” এবং “extensively verified” তাই পরস্পরের বিকল্প শব্দ নয়। প্রশিক্ষণে কোনো ভাষা থাকা মডেলটির সেই ভাষা প্রক্রিয়াকরণের সম্ভাবনা বোঝায়; production ব্যবহারের উপযোগিতা নির্ধারণে নির্ভুলতা, বিলম্ব, যতিচিহ্ন, নাম ও সংখ্যা শনাক্তকরণ এবং বাস্তব অডিওতে স্থিতিশীলতার আলাদা ফল প্রয়োজন।

Code-switching-এর দাবি কত দূর যায়

Meta মডেলটিকে একই বাক্যের ভেতরে কিংবা দুই বাক্যের মধ্যে নির্বিঘ্নে ভাষা বদল শনাক্ত করতে সক্ষম বলে বর্ণনা করেছে। প্রকাশ্য demonstration-এ Mandarin Chinese ও English মিশ্র কথার নমুনা রয়েছে। Language, keyword ও context biasing-এর মাধ্যমে নির্দিষ্ট ভাষা, নাম, স্থান বা বিষয়ভিত্তিক শব্দের জন্য অতিরিক্ত প্রসঙ্গ দেওয়ার ব্যবস্থাও আছে।

কিন্তু “arbitrary code-switching” একটি সামগ্রিক প্রযুক্তিগত ক্ষমতার বর্ণনা; প্রতিটি সম্ভাব্য ভাষাজোড়া সমানভাবে পরীক্ষা করার প্রমাণ নয়। Mandarin–English নমুনা থেকে বাংলা–ইংরেজি বা বাংলা–হিন্দি কথোপকথনের নির্ভুলতা নির্ধারণ করা যায় না। একইভাবে বাংলাদেশের উচ্চারণ এবং ভারতের বিভিন্ন অঞ্চলের বাংলা যে সমানভাবে সামলানো হবে, তারও প্রকাশ্য পরিমাপ নেই।

বাংলা মিশ্র কথায় পণ্যের ইংরেজি নাম, সংক্ষিপ্ত রূপ, সংখ্যা ও বাংলা ক্রিয়া একই বাক্যে আসতে পারে। Muse Voice Transcribe-এর স্থাপত্য এমন ভাষা বদলের জন্য তৈরি হলেও এই নির্দিষ্ট ধরনের input নিয়ে ফল প্রকাশিত হয়নি। সেই সীমাটিই শিরোনামের “বাংলা যাচাই হয়নি” কথাটির অর্থ; এটি বাংলা একেবারেই কাজ করবে না—এমন দাবি নয়।

API, Mac ও Muse Code-এ প্রাথমিক প্রাপ্যতা

প্রকাশের সময় মডেলটি Meta Model API, Meta AI for Mac এবং Muse Code-এ ব্যবহারের জন্য আনা হয়েছে। 9to5Mac-এর launch coverage অনুযায়ী, API-র ঘোষিত দাম প্রতি ১,০০০ অডিও মিনিটে ৩ ডলার, অর্থাৎ ঘণ্টাপ্রতি ০.১৮ ডলার; Mac-এ Fn key ধরে অন্য application-এ dictation দেওয়ার সুবিধাও চালু হয়েছে।

এই প্রাপ্যতার ঘোষণা বাংলাদেশ বা ভারতের প্রতিটি account ও billing region-এ একই access নিশ্চিত করে না। প্রকাশিত প্রতিবেদনে অঞ্চলভিত্তিক eligibility বা rollout-এর পূর্ণ বিবরণ নেই। ফলে API-তে একটি মডেল থাকা, কোনো নির্দিষ্ট account থেকে সেটি পাওয়া এবং একটি ভাষায় production-মানের ফল পাওয়া—তিনটি আলাদা বিষয়।

দামটিও launch-time API price, দীর্ঘমেয়াদি নিশ্চয়তা নয়। অন্যদিকে Mac-এর dictation একটি নির্দিষ্ট product surface; তার উপস্থিতি থেকে API-র সব feature বা প্রতিটি অঞ্চলের desktop availability অনুমান করা যাবে না।

বাংলা ও recording consent নিয়ে যা অনির্ধারিত

সম্মতি নিয়ে Muse Voice Transcribe-এ বাংলা-ইংরেজি মিশ্র কথার প্রতিলিপি আলাদাভাবে যাচাই করা হচ্ছে।

Meta-র ওয়েব demonstration-এ microphone audio প্রতিলিপি তৈরির জন্য process করা হয় এবং audio সংরক্ষণ না করার কথা লেখা আছে। একই জায়গায় ব্যবহারকারীকে ধারণ করা অডিও রেকর্ড করার অনুমতি আছে বলে নিশ্চিত করতে হয়। এই বক্তব্য শুধু Meta-র demonstration-এর data handling বর্ণনা করে; তৃতীয় পক্ষের কোনো application একই নীতি অনুসরণ করবে, তা এর মাধ্যমে নিশ্চিত হয় না।

Developer কোনো বৈঠক, সাক্ষাৎকার বা কলের জন্য API যুক্ত করলে audio retention, transcript storage, access control এবং অংশগ্রহণকারীদের সম্মতি সেই application-এর নিজস্ব বাস্তবায়ন ও প্রযোজ্য নিয়মের ওপরও নির্ভর করবে। Speaker diarization কার বক্তব্য কোনটি তা আলাদা করতে পারে, কিন্তু রেকর্ড করার অনুমতি সৃষ্টি করে না।

এখনকার নিশ্চিত চিত্র হলো, Muse Voice Transcribe real-time ASR, endpointing, ২০টির বেশি বক্তার diarization এবং কথার মধ্যে ভাষা বদল সমর্থন করে। ৭০টির বেশি প্রশিক্ষণ-ভাষার মধ্যে ২৫টি extensively verified হলেও বাংলার জন্য আলাদা প্রকাশ্য ফল বা বাংলা-ভিত্তিক code-switching demonstration পাওয়া যায়নি। Meta বাংলা-নির্দিষ্ট benchmark, নমুনা বা স্পষ্ট language documentation প্রকাশ করলে তবেই এর নির্ভরযোগ্যতার সীমা আরও নির্দিষ্ট করা যাবে।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0