اے آئی اور خود کاری

Gemini ویڈیو کا صرف ضروری حصہ دیکھے گا، tokens میں 88٪ تک کمی

|مصنف: QUASA ادارتی ٹیم|6 منٹ مطالعہ
Gemini ویڈیو کا صرف ضروری حصہ دیکھے گا، tokens میں 88٪ تک کمی

Google نے یکم ستمبر 2026 کو Gemini کا agentic video understanding mode جاری کیا، جس میں ماڈل پوری ویڈیو کو مقرر رفتار سے پڑھنے کے بجائے سوال کے مطابق متعلقہ frames، audio اور transcript منتخب کرتا ہے۔ NYU Shanghai کی آزاد رپورٹ کے مطابق launch کے وقت یہ Gemini 3.7 Flash، 3.6 Flash اور 3.5 Flash-Lite پر uploaded اور YouTube videos کے لیے Gemini API، Google AI Studio اور Gemini Enterprise Agent Platform میں دستیاب تھا؛ بعد کی documentation میں 3.8 Flash بھی شامل ہو گیا۔

سرخی میں درج 88٪ token reduction ہر درخواست کی ضمانت نہیں، بلکہ Gemini 3.7 Flash کے لیے Google کے اپنے benchmarks میں حاصل ہونے والی زیادہ سے زیادہ کمی ہے۔ benchmark اعداد کی آزاد جانچ کے مطابق 1H-VideoQA میں tokens فی سوال 397,600 سے 47,700 اور LVBench میں 300,300 سے 36,000 ہوئے؛ دونوں میں کمی 88٪ تھی، جبکہ Minerva پر کمی 58.4٪ رہی۔

Static 1-FPS کے بجائے انتخاب کیسے ہوتا ہے

ایک ہی طویل ویڈیو میں static 1-FPS sampling اور Gemini کی متعلقہ حصے تک محدود agentic inspection کا موازنہ

Static processing میں Gemini ویڈیو سے مقرر رفتار پر frames نکال کر انہیں ایک ہی pass میں context میں رکھتا ہے؛ default رفتار ایک frame فی سیکنڈ ہے۔ یہ مختصر clips یا پوری recording کی مسلسل coverage کے لیے سیدھا طریقہ ہے، لیکن طویل ویڈیو میں ایسے frames بھی tokens لیتے ہیں جن کا سوال سے کوئی تعلق نہیں ہوتا۔ تیز حرکت یا ایک سیکنڈ سے مختصر تبدیلی دو samples کے درمیان رہ بھی سکتی ہے۔

Agentic mode میں prompt یہ طے کرتا ہے کہ ماڈل کس چیز کی تلاش کرے۔ Gemini پہلے transcript میں متعلقہ timestamp ڈھونڈ سکتا ہے، پھر اسی محدود حصے کے frames یا audio حاصل کر کے ضرورت پڑنے پر frame rate اور resolution بدلتا ہے۔ کسی مشکوک حرکت، مختصر cut یا گنتی کی تصدیق کے لیے وہ منتخب window دوبارہ دیکھ سکتا ہے، جبکہ باقی timeline کو اتنی ہی باریکی سے context میں لانا ضروری نہیں رہتا۔

یہ محض FPS کم کرنے کا دوسرا نام نہیں۔ Static mode میں developer کم FPS مقرر کر کے tokens بچا سکتا ہے، مگر اس کے ساتھ اہم مختصر لمحہ چھوڑنے کا خطرہ بڑھتا ہے۔ Agentic processing پہلے کم خرچ تلاش اور پھر متعلقہ حصے کی focused inspection کرتی ہے، اس لیے خرچ اور تفصیل کا توازن ہر prompt کے مطابق بدل سکتا ہے۔

88٪ کمی کس baseline سے نکلی

Gemini 3.7 Flash کے Google benchmark میں static processing کے مقابل agentic mode کے کم tokens استعمال کرنے کا نتیجہ

Google کے شائع کردہ tests میں ایک ہی Gemini 3.7 Flash کو standard processing اور agentic processing کے ساتھ چلایا گیا۔ Static configuration میں high thinking level، low media resolution اور 1 FPS استعمال ہوا؛ لہٰذا 88٪ کا موازنہ اسی baseline سے ہے، کسی developer کی پہلے سے کم FPS یا پہلے سے filter کی ہوئی pipeline سے نہیں۔

1H-VideoQA پر accuracy 87.5٪ سے 88.5٪ اور LVBench پر 85.1٪ سے 88.6٪ ہوئی۔ Minerva میں tokens 80,900 سے 33,600 ہوئے، جبکہ accuracy 73.7٪ سے 79.0٪ پہنچی؛ Google نے اسے تقریباً 7٪ relative improvement کے طور پر پیش کیا، جو 5.3 percentage points بنتا ہے۔ یوں سب سے بڑی token بچت اور سب سے بڑا quality gain ایک ہی benchmark کا نتیجہ نہیں تھے۔

Google نے تمام standard video-analysis benchmarks کے مجموعی نتائج سے analysis cost میں 66٪ تک کمی بھی بتائی، مگر اس دعوے کے لیے فی benchmark مکمل cost table شائع نہیں کیا۔ یہ numbers vendor measurements ہیں، آزاد production benchmark نہیں؛ ویڈیو کی طوالت، transcript کی دستیابی، زبان، شور اور سوال کی نوعیت اصل token استعمال بدل سکتے ہیں۔

Models، APIs اور activation flag

Gemini API release notes یکم ستمبر کی release کو Interactions اور GenerateContent APIs پر Gemini 3.7 Flash، 3.6 Flash اور 3.5 Flash-Lite کے لیے درج کرتی ہیں۔ موجودہ support فہرست میں Gemini 3.8 Flash بھی شامل ہے، مگر اسے اصل launch فہرست میں شامل سمجھنا درست نہیں کیونکہ 3.8 Flash اگلے دن، 2 ستمبر کو الگ release ہوا۔

Interactions API کے video input میں ضروری setting processing: "agentic" ہے۔ مختصر ساخت یوں ہے: video object میں type، URI، mime type اور processing کی agentic value دی جاتی ہے، پھر text input میں سوال شامل ہوتا ہے۔ Response کے steps میں processing_call اور processing_result کی موجودگی سے تصدیق کی جا سکتی ہے کہ ماڈل نے timeline کو dynamically navigate کیا۔

یہ mode uploaded files اور public YouTube URLs دونوں قبول کرتا ہے۔ Standard Gemini API token pricing لاگو ہوتی ہے اور الگ feature fee نہیں، لیکن total bill میں navigation کے thought tokens، مانگے گئے frames، audio یا transcript کے tool-use tokens اور final output شامل ہو سکتے ہیں۔ ایک ہی request میں مختلف video inputs کے لیے static اور agentic modes الگ بھی مقرر کیے جا سکتے ہیں۔

کس workload میں کون سا mode موزوں ہے

میڈیا archive میں transcript سے متعلقہ لمحہ تلاش کر کے اسی حصے کو باریک بینی سے دیکھتا Gemini agentic mode
  • طویل recording میں مخصوص لمحہ: agentic mode، کیونکہ transcript یا timeline search کے بعد محدود segment کی تفصیلی جانچ ہو سکتی ہے۔
  • تیز حرکت، anomaly یا گنتی: agentic mode، کیونکہ منتخب window کو زیادہ FPS پر دوبارہ دیکھا جا سکتا ہے۔
  • پانچ منٹ سے مختصر latency-sensitive clip: static mode، کیونکہ agentic navigation کے داخلی tool round-trips پہلے token تک وقت بڑھا سکتے ہیں۔
  • ہر حصے یا frame کی مسلسل coverage: static mode، کیونکہ یہاں تقریباً پوری input متعلقہ ہے اور selective loading مطلوبہ coverage چھوڑ سکتی ہے۔
  • کئی گھنٹوں کی archive search: agentic mode، خصوصاً جب سوال کسی نام، واقعے، آواز یا مختصر visual cue تک محدود ہو۔

پاکستانی ویڈیو پلیٹ فارم اور media-automation pipeline کے لیے 88٪ کو budget calculator میں مستقل discount نہیں سمجھنا چاہیے۔ Archive search، highlight extraction اور مخصوص واقعے کی retrieval میں غیر متعلقہ دورانیہ چھوڑنے کی گنجائش زیادہ ہے؛ مکمل transcription، مسلسل shot logging یا compliance coverage میں تقریباً پوری timeline درکار ہو سکتی ہے۔ ایک منصفانہ production comparison میں ایک ہی video اور prompt کے لیے total tokens، accuracy، latency اور فی درخواست لاگت الگ ناپنی ہوں گی۔

ابھی کیا دستیاب ہے اور کیا باقی ہے

Developer interfaces اور Gemini Enterprise Agent Platform میں یہ جاری شدہ capability ہے، محض preview کا وعدہ نہیں۔ اس کے برعکس consumer Gemini app میں Flash اور Flash-Lite users کے لیے rollout کو صرف “soon” کہا گیا ہے، جبکہ YouTube watch page کے Ask YouTube میں استعمال آنے والے مہینوں کے لیے طے کیا گیا؛ دونوں کے لیے حتمی تاریخ نہیں دی گئی۔

فی الحال ثابت شدہ نتیجہ یہ ہے کہ Gemini سوال کے مطابق ویڈیو کے محدود moments اور media signals منتخب کر سکتا ہے، اور Google کے مخصوص long-video benchmarks میں static 1-FPS baseline کے مقابل tokens کی زیادہ سے زیادہ کمی 88٪ رہی۔ مختلف زبانوں، noisy audio، نامکمل transcripts اور production-scale workloads پر آزاد نتائج آنے تک اسے ممکنہ بالائی فائدہ سمجھنا زیادہ درست ہے، عمومی ضمانت نہیں۔

یہ بھی پڑھیں:

شیئر کریں:

ہمارا نیوز لیٹر سبسکرائب کریں

ویب 3، AI اور کرپٹو کی تازہ خبریں براہ راست اپنے اِن باکس میں پائیں۔

0