Gemini 3.8 Live কথা বলেই tool চালায়—বাংলা সমর্থন মানেই নির্ভুলতা নয়

|লেখক: QUASA সম্পাদকীয় দল|5 মিনিটের পাঠ| 2
Gemini 3.8 Live কথা বলেই tool চালায়—বাংলা সমর্থন মানেই নির্ভুলতা নয়

Google ১৫ সেপ্টেম্বর ২০২৬-এ Gemini 3.8 Live ও Gemini 3.8 Live Extended Thinking চালু করেছে। Developer-দের জন্য Gemini API ও Google AI Studio-তে সাধারণভাবে উপলভ্য মডেল দুটি কথোপকথন চালিয়ে যাওয়ার সময় background-এ tool বা API call সম্পন্ন করতে পারে—তারিখ, সক্ষমতা ও প্রাপ্যতার এই অবস্থান TechRepublic-এর ১৭ সেপ্টেম্বরের প্রতিবেদনে ও নিশ্চিত করা হয়েছে।

Gemini 3.8 Live-এর মূল সংযোজন হলো live visual input থেকে প্রসঙ্গ নেওয়া, কথার মাঝখানে সমর্থিত ভাষা শনাক্ত ও বদলানো এবং কোনো সংযুক্ত tool-এর কাজ চললেও আলাপ থামিয়ে না দেওয়া। বাংলা সমর্থিত ভাষার তালিকায় থাকলেও স্থানীয় উচ্চারণ, বাংলা-ইংরেজি code-switching কিংবা বাংলা নাম ও সংখ্যা বোঝার নির্ভুলতা নিয়ে আলাদা ফল প্রকাশিত হয়নি—তাই সমর্থনকে পরীক্ষিত নির্ভুলতার নিশ্চয়তা বলা যাচ্ছে না।

কথোপকথন চললেও tool-এর কাজ শেষ নাও হতে পারে

Gemini 3.8 Live-এ asynchronous function calling ব্যবহারের ফলে model একটি অনুরোধ স্বীকার করে audio response চালিয়ে যেতে পারে, যখন ঘোষিত function বা API background-এ কাজ করছে। তবে সেই tool developer-কেই আগে সংযুক্ত ও প্রয়োজনীয় অনুমতি দিতে হবে; model নিজে থেকে যেকোনো বাহ্যিক ব্যবস্থা নিয়ন্ত্রণের অধিকার পায় না।

এখানে সাবলীলভাবে কথা বলা এবং কাজটি সম্পন্ন হওয়া দুটি আলাদা অবস্থা। কোনো booking, তথ্য অনুসন্ধান বা বহু ধাপের প্রক্রিয়া চলার সময় model অগ্রগতির কথা জানাতে পারে, অথচ সংশ্লিষ্ট function তখনো শেষ হয়নি বা ব্যর্থও হতে পারে। ফলে spoken response শেষ হওয়াকে transaction সফল হওয়ার প্রমাণ ধরা ঠিক হবে না; application-কে tool-এর চূড়ান্ত status আলাদাভাবে ধরতে হবে।

Visual input একই কথোপকথনে আরেকটি প্রসঙ্গ যোগ করে। Audio ও text-এর সঙ্গে image বা video stream থেকে দৃশ্য বুঝে model উত্তর দিতে পারে; Google-এর প্রদর্শনীতে chessboard দেখে খেলা নিয়ে live dialogue চালানো হয়েছে। এটি ছবি তৈরির feature নয়, বরং দেখা ও শোনা তথ্যকে একই কথোপকথনের context হিসেবে ব্যবহারের ক্ষমতা।

৯৭ ভাষার দাবি আর বাংলা নির্ভুলতার প্রমাণ এক নয়

Launch-এর সময় Google বলেছে, Gemini 3.8 Live কথোপকথনের মাঝখানে ৯৭টি সমর্থিত ভাষা স্বয়ংক্রিয়ভাবে শনাক্ত করে এক ভাষা থেকে অন্য ভাষায় যেতে পারে। অন্যদিকে, পরিবর্তনশীল Live API language তালিকায় এখন মোট ৯৯টি ভাষা এবং Bengali-এর BCP-47 code হিসেবে bn দেখানো হচ্ছে। প্রথম সংখ্যাটি নতুন model নিয়ে launch claim, দ্বিতীয়টি পুরো Live API-র বর্তমান documentation; তাই এগুলোকে একই সময় ও একই পরিসরের পরস্পরবিরোধী হিসাব বলা যায় না।

বাংলাদেশ ও বাংলা ভাষাভাষী ভারতের পাঠকের জন্য বড় অজানা অংশটি হলো ভাষাভিত্তিক পরীক্ষার ফল। প্রকাশিত নথিতে বাংলাদেশের আঞ্চলিক উচ্চারণ, পশ্চিমবঙ্গের কথ্য রূপ, একই বাক্যে বাংলা ও ইংরেজির মিশ্রণ, স্থানীয় ব্যক্তি ও স্থানের নাম কিংবা মুখে বলা অঙ্কের জন্য আলাদা word-error rate নেই। “Bengali supported” তাই input নেওয়া ও response দেওয়ার সক্ষমতা বোঝায়; সব ধরনের বাংলায় সমান মান বোঝায় না।

Language switching এবং সঠিক tool argument তৈরিও এক পরীক্ষা নয়। Model কথার মধ্যে ভাষা বদল শনাক্ত করতে পারলেও নাম, তারিখ বা সংখ্যার একটি অংশ ভুল শুনে function-এ ভুল মান পাঠাতে পারে। কথোপকথন স্বাভাবিক শোনালেও সেই ভুল বাস্তব কাজের ফল বদলে দিতে পারে—বিশেষত booking, account lookup বা পরিচয়সংক্রান্ত তথ্যের ক্ষেত্রে।

Live ও Extended Thinking-এর লক্ষ্য আলাদা

Gemini 3.8 Live কম latency ও বেশি পরিমাণ real-time dialogue-এর জন্য তৈরি; এতে interleaved reasoning থাকলেও আলাদা thinking level নির্ধারণের সুবিধা নেই। Asynchronous function calling default হলেও backward compatibility-এর জন্য blocking mode রাখা হয়েছে।

Gemini 3.8 Live Extended Thinking জটিল, বহু ধাপের অনুরোধে background reasoning-এর সঙ্গে spoken update চালিয়ে যেতে পারে। এই সংস্করণে non-blocking asynchronous call-ই প্রয়োজন, কারণ একটি মধ্যবর্তী verbal response শেষ হওয়ার পরও reasoning বা tool-এর কাজ চলতে পারে। অতএব দুই model-এর মধ্যে পার্থক্য শুধু কথার মানে নয়; দীর্ঘ কাজের অবস্থা কীভাবে ধরে রাখা হয়, সেটিও গুরুত্বপূর্ণ।

Google সামগ্রিক speech-to-speech ও agentic benchmark-এ Extended Thinking-এর শক্তিশালী ফল দেখিয়েছে। কিন্তু সেসব score বাংলা speech recognition-এর আলাদা evaluation নয়, আর tool-সহ একটি agentic configuration-এর ফলকে শুধু voice model-এর নির্ভুলতা বলাও ঠিক হবে না। Model, prompt, সংযুক্ত tool এবং পরীক্ষার পরিবেশ মিলেই ওই ফল তৈরি করে।

Model card-এ hallucination, timeout ও পুরোনো cutoff

Google DeepMind-এর model card অনুযায়ী, দুই model audio, image, video ও text input নেয়; input context সর্বোচ্চ ১২৮K token এবং audio ও text output-এর সীমা ৬৪K token। একই নথিতে hallucination, মাঝেমধ্যে ধীর response বা timeout এবং জানুয়ারি ২০২৫ knowledge cutoff-এর কথা স্পষ্ট করা হয়েছে।

Knowledge cutoff-এর অর্থ, model-এর শেখা তথ্য থেকে ২০২৫ সালের জানুয়ারির পরের ঘটনাকে স্বয়ংক্রিয়ভাবে সাম্প্রতিক ও নির্ভুল ধরে নেওয়া যাবে না। Search, database বা অন্য API সংযুক্ত থাকলে model নতুন তথ্য আনতে পারে, কিন্তু tool-এর ফল ব্যাখ্যা করার সময় hallucination-এর সম্ভাবনা দূর হয় না। একইভাবে background task চলাকালে কথোপকথন সচল থাকলেও timeout হলে মূল কাজ অসম্পূর্ণ থেকে যেতে পারে।

প্রাপ্যতা বিস্তৃত হচ্ছে, বাংলা মানের প্রশ্ন খোলা

Developer-দের জন্য দুটি model-ই Gemini API ও Google AI Studio-তে সাধারণভাবে পাওয়া যাচ্ছে। Consumer ও enterprise channel-এ অবস্থা এক নয়: Gemini 3.8 Live Search Live-এ rollout হচ্ছে, enterprise সংস্করণ private preview-তে; Extended Thinking Gemini Live ও নির্দিষ্ট Google AI subscription-এর Workspace অভিজ্ঞতায় যাচ্ছে। ফলে বাংলাদেশ বা ভারতের প্রতিটি account-এ একই feature একই সময়ে পৌঁছাবে—এমন নিশ্চয়তা দেওয়া যায় না।

এখন পর্যন্ত নিশ্চিত চিত্রটি দ্বিমুখী: Gemini 3.8 Live visual context ব্যবহার করে কথোপকথন বজায় রেখেই সংযুক্ত tool চালাতে পারে, এবং Live API-র ভাষা তালিকায় বাংলা আছে। কিন্তু বাংলা recognition, code-switching, স্থানীয় উচ্চারণ ও tool-এ পাঠানো বাংলা তথ্যের নির্ভুলতা নিয়ে স্বতন্ত্র ফল না আসা পর্যন্ত ভাষা-সমর্থন সক্ষমতার দরজা—মানের চূড়ান্ত প্রমাণ নয়।

আরও পড়ুন:

শেয়ার করুন:

আমাদের নিউজলেটার নিন

সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।

0