Gemini 3.8 Live يفكر أثناء المحادثة، لكن التفكير يُحسب من المخرجات

أطلقت Google في 15 سبتمبر 2026 نموذجي Gemini 3.8 Live وGemini 3.8 Live Extended Thinking للمحادثات الصوتية الآنية، وحدّثت إعلانها في 17 سبتمبر. ويبيّن إعلان Google عن النموذجين أن الأول موجه إلى السرعة وكفاءة التشغيل على نطاق واسع، بينما ينفذ الثاني استدلالًا متعدد الخطوات ويتحدث أثناء استمرار العمل في الخلفية.
بدأ طرح النموذجين للمطورين عبر Gemini API وGoogle AI Studio في التاريخ نفسه، فيما بقي وصول المؤسسات عبر Gemini Enterprise ضمن معاينة خاصة. ولا تفرض بطاقة السعر معدلًا أعلى على Extended Thinking، لكن رموز التفكير تُحتسب ضمن المخرجات؛ لذلك قد تختلف كلفة جلستين بالسعر الوحدوي نفسه تبعًا لكمية الاستدلال والصوت الناتج.
ما الذي يتغير عندما يفكر النموذج أثناء الكلام؟
Gemini 3.8 Live هو النموذج الأساسي للمحادثات منخفضة التأخير والمهام المباشرة. يستقبل النص والصور والفيديو والصوت، ويعيد النص أو الصوت، ويمكنه تشغيل أدوات واستدعاءات API في الخلفية مع استمرار الحوار. يناسب ذلك سؤالًا ينتهي باسترجاع معلومة، أو تغيير حجز واحد، أو تنفيذ أمر واضح بأداة سريعة.
يضيف Gemini 3.8 Live Extended Thinking استدلالًا خلفيًا قابلًا للضبط بثلاثة مستويات: منخفض ومتوسط وعال. يستطيع إصدار عبارة تمهيدية قصيرة، ثم تقديم تحديثات صوتية أثناء تحليل طلب معقد أو انتظار أدوات غير متزامنة، بدل ترك المتصل أمام صمت طويل. وتستهدف هذه البنية مهام مثل التشخيص متعدد المراحل، ومقارنة خيارات من مصادر مختلفة، وتنسيق سلسلة من الحجوزات أو الاستدعاءات.
هذا ليس فرقًا في الاسم فقط، بل في دورة حياة الجلسة أيضًا. في النسخة الممتدة قد يعني اكتمال مقطع كلامي أن النموذج لا يزال يعمل؛ لذلك يجب على التطبيق تتبع حالة التفاعل حتى تنتقل من العمل الجاري إلى الخمول. كما تتطلب أدوات Extended Thinking تصريحات غير متزامنة، بينما يقبل النموذج الأساسي أدوات متزامنة أو غير متزامنة.
سعر موحد لا يعني فاتورة متطابقة
تضع صفحة تسعير Gemini API النموذجين في الجدول نفسه. في الفئة القياسية المدفوعة يبلغ إدخال النص 0.75 دولار لكل مليون رمز، وإدخال الصوت 3 دولارات لكل مليون رمز أو نحو 0.005 دولار للدقيقة، وإدخال الصور والفيديو دولارًا واحدًا لكل مليون رمز. وتبلغ المخرجات 4.50 دولارات لكل مليون رمز نصي و12 دولارًا لكل مليون رمز صوتي، أو نحو 0.018 دولار للدقيقة، مع إدراج رموز التفكير ضمن المخرجات.
المعنى الدقيق لعبارة «السعر نفسه» هو تساوي المعدل المنشور، لا تساوي الاستهلاك. يمكن لجلسة Extended Thinking أن تنتج استدلالًا خلفيًا وتحديثات صوتية أكثر من جلسة مباشرة، فتزداد وحدات المخرجات المدفوعة من دون وجود علاوة مستقلة باسم النموذج. كما أن تكلفة الأدوات والحوسبة الخارجية تبقى منفصلة عن رسوم النموذج.
في مثال افتراضي، تتلقى خدمة 100 جلسة، مدة الصوت الداخل في كل منها عشر دقائق، ويصدر النموذج أربع دقائق من الصوت. تبلغ كلفة الإدخال 100 × 10 × 0.005، أي 5 دولارات، وكلفة الصوت الخارج 100 × 4 × 0.018، أي 7.20 دولارات؛ وبذلك تصل الكلفة الصوتية إلى 12.20 دولارًا قبل أي مخرجات أخرى.
إذا سجلت بيانات الاستخدام أيضًا نصف مليون رمز من مخرجات التفكير المحتسبة بالمعدل النصي، تضاف 2.25 دولار وترتفع الحصيلة إلى 14.45 دولارًا. أما إذا وقع الحجم نفسه في فئة المخرجات الصوتية، فتبلغ إضافته 6 دولارات؛ ولهذا لا يجوز اختيار المعدل بالحدس أو استنتاجه من مدة التسجيل وحدها. المثال حسابي لا يتنبأ باستهلاك فعلي، والمصدر الحاسم لكل تطبيق هو تصنيف الرموز وكميتها في بيانات استخدام API.
شجرة القرار بين Live وExtended Thinking
الاختيار يبدأ من تعقيد المهمة وزمن الأدوات، لا من افتراض أن النسخة ذات الاستدلال الأعمق أفضل دائمًا. وتخلص مراجعة DataCamp المستقلة إلى أن Live هو الخيار الافتراضي لمعظم الوكلاء الصوتيين، بينما تصبح النسخة الممتدة منطقية عندما يحتاج الوكيل إلى التخطيط أو المقارنة أو انتظار أدوات بطيئة.
- اختر Gemini 3.8 Live عندما تكون المهمة مباشرة، أو تنتهي ببحث واحد، أو تستخدم أداة تعيد النتيجة سريعًا، وتكون سرعة تبادل الأدوار أولوية.
- اختر Extended Thinking عندما يلزم فحص بيانات متعددة، أو تطبيق قواعد مترابطة، أو تنسيق أدوات تستغرق عدة ثوان، ويصبح الصمت أثناء المعالجة مشكلة في تجربة الاتصال.
- وجّه الطلبات حسب النية عندما تجمع الخدمة بين النوعين: تبقى الطلبات البسيطة على Live، وتنتقل النيات المعقدة فقط إلى Extended Thinking.
- قارن النتيجة الكاملة بقياس زمن إنجاز المهمة، ونسبة اكتمالها، ومدة الصوت الخارج، ورموز التفكير؛ فالسعر الوحدوي وحده لا يكشف الخيار الأقل كلفة.
لا يعني ذلك أن كل أداة خارجية تستدعي النسخة الممتدة. إذا كانت الأداة تستجيب خلال أجزاء من الثانية ولا تتطلب تخطيطًا أو مقارنة، فقد تضيف العبارات المرحلية كلامًا لا يحتاج إليه المتصل. أما عندما تمتد المهمة عبر أنظمة وخطوات عدة، فقد يبرر استمرار الحوار استهلاكًا أعلى للمخرجات.
الإتاحة واضحة للمطورين وأضيق للمؤسسات
يتاح النموذجان للمطورين عبر Gemini API وGoogle AI Studio. أما Gemini Enterprise فكان في معاينة خاصة عند الإطلاق، بينما وُصف الوصول عبر Gemini Enterprise for Customer Experience بأنه قادم لاحقًا من دون موعد محدد. وعلى واجهات المستهلكين، توزع الطرح بين Search Live للنموذج الأساسي وGemini Live وبعض خدمات Workspace للنسخة الممتدة وفق نوع الاشتراك.
ما يزال المتغير الأهم غير منشور كمتوسط عام: عدد رموز التفكير التي تستهلكها كل فئة من المكالمات عند كل مستوى استدلال. لذلك يثبت الإطلاق أن التفكير يمكن أن يستمر داخل المحادثة وأنه يدخل في بند المخرجات، لكنه لا يثبت أن Extended Thinking أغلى في كل مهمة. الفارق الفعلي سيظل تابعًا لتعقيد الطلب ومدة الصوت وبيانات الاستخدام التي يسجلها كل وكيل.
اقرأ أيضًا:
اشترك في نشرتنا الإخبارية
احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.