NVIDIA AVO حلّ 183 مستوى: النتيجة الكاملة تخفي قيدًا مهمًا

أعلنت NVIDIA في 21 أغسطس 2026 أن نظام AVO، المستخدم مع Claude Opus 5، أكمل مستويات ARC-AGI-3 العامة الـ183 ضمن 25 بيئة وسجل 100.00 على مقياس RHAE. وتبيّن نتائج NVIDIA التقنية أن هذا التشغيل احتاج إلى 6,624 إجراءً، وأن الدرجة تخص النظام الوكيلي الكامل والمجموعة العامة وحدها.
المؤكد في إعلان 21 أغسطس هو إكمال AVO المجموعة العامة، لا اجتياز مجموعات ARC-AGI-3 المحجوبة. وتوضح مراجعة Musthave.AI المستقلة أن NVIDIA لم تنشر نتيجة للمجموعتين شبه الخاصة أو الخاصة، وأن المقارنات المتاحة لا تعزل أثر بنية AVO عن اختلافات إعداد التشغيل.
ماذا تعني نتيجة 100.00؟

النتيجة الكاملة تعني أن النظام أنهى كل مستويات المجموعة العامة مع احتساب كفاءة الإجراءات. فمقياس RHAE لا يسجل الوصول إلى الحل فقط؛ بل يجمع إنجاز المستويات مع عدد الإجراءات المستخدمة قياسًا إلى خطوط أساس بشرية على مستوى كل مستوى، ثم يجمع الأداء عبر البيئات.
لذلك يجب فصل عناصر بطاقة النتيجة: عدد البيئات ليس عدد المستويات، وعدد الإجراءات ليس الدرجة النهائية. كما أن تسجيل 100.00 لا يعني أن الوكيل عرف القواعد مسبقًا أو أن كل إجراء اتخذه كان صحيحًا؛ بل يعني أنه حقق النتيجة القصوى وفق طريقة احتساب المقياس في التشغيل العام المنشور.
هذه أيضًا نتيجة لنظام كامل، وليست درجة مستقلة لـClaude Opus 5. النموذج ولّد الاستدلالات داخل الحلقة، لكن الذاكرة المستمرة والإشراف وتمثيل الملاحظات وإدارة السياق وآلية التنفيذ كلها شاركت في إنتاج المسار الذي انتهى بإكمال المستويات.
كيف حوّلت بنية AVO قدرة النموذج إلى تقدم طويل الأفق؟

AVO ليس نموذجًا لغويًا جديدًا، بل بنية وكيل تحيط بالنموذج وتدير العمل الممتد عبر تفاعلات كثيرة. تحفظ الذاكرة ما سبق اكتشافه ونتائج المحاولات، بينما يراقب المشرف المسار العام بحثًا عن الركود أو الدورات غير المنتجة، ويمكنه دفع الوكيل نحو استراتيجية بديلة.
في إعداد ARC-AGI-3، تلقى Claude Opus 5 كل ملاحظة بوصفها شبكة نصية دقيقة بقياس 64 × 64، من دون صور أو رموز بصرية. حصل الوكيل على الإجراءات المتاحة من دون وصف لقواعد البيئة أو هدفها، ثم راقب أثر أفعاله وحدّث فرضياته واحتفظ بالمعلومات المفيدة للمراحل اللاحقة.
هذه الآلية تفسر سبب أهمية الغلاف الوكيلي، لكنها لا تقيس مقدار مساهمة كل جزء منه. فإثبات أن الذاكرة وحدها، أو المشرف وحده، أحدث فارقًا محددًا يتطلب إبقاء النموذج والبيئات وميزانية الإجراءات وإعداد الاستدلال ثابتة، ثم تغيير مكوّن واحد في كل تجربة؛ وهذه السلسلة من اختبارات العزل لم تُنشر مع النتيجة.
لماذا يختبر ARC-AGI-3 أكثر من الإجابة الصحيحة؟
ARC-AGI-3 معيار تفاعلي قائم على بيئات دورية، لا مجموعة أسئلة ثابتة ذات إجابات مباشرة. ووفق إعلان ARC Prize عن المعيار، يدخل الوكيل البيئات بلا تعليمات أو قواعد أو أهداف معلنة، وعليه استكشاف طريقة عملها واكتشاف معنى الفوز ونقل ما تعلمه إلى مستويات أصعب.
بهذا التصميم تصبح الذاكرة والتكيف والتعافي من الفرضيات الخاطئة جزءًا من القدرة المقاسة. قد يختار نموذج إجراءً مناسبًا في لحظة منفردة، لكنه لن ينجح على أفق طويل إذا نسي نتائج الاستكشاف، أو كرر محاولات فاشلة، أو استنفد الإجراءات قبل اكتشاف الهدف.
تُظهر تجربة AVO أن بنية طُورت أصلًا لدعم أعمال هندسية طويلة أمكن تكييفها مع واجهة تفاعلية مختلفة: فرضية، ثم إجراء، فملاحظة للنتيجة، ثم تحديث للحالة. هذا دليل على قابلية نقل حلقة العمل بين مجالين، لكنه لا يثبت أن الاستراتيجيات الناتجة ستنتقل إلى كل بيئة جديدة.
لماذا لا تكفي المقارنات المتاحة لعزل أثر البنية؟

قارنت NVIDIA تشغيل AVO بتشغيل منشور لنظام VISTA استخدم عائلة النموذج نفسها وأكمل المستويات العامة ذاتها، لكن AVO استخدم إجراءات أقل بنحو 12%. هذا فرق وصفي بين تشغيلين، لا تجربة محكومة؛ إذ تختلف البنيتان في الواجهة وتمثيل الملاحظات والذاكرة وإدارة السياق ومكونات التنفيذ.
وينطبق التحفظ نفسه على المقارنة مع نتيجة تقارب 30% لـClaude Opus 5 في إعداد آخر. اختلاف جهد الاستدلال والغلاف وطريقة التقييم يمنع طرح الرقمين من بعضهما واعتبار الفارق قياسًا خالصًا لما أضافه AVO. ما تثبته المقارنة هو أن تقييم النموذج منفردًا لا يصف بالضرورة أداء النظام الوكيلي المحيط به.
القيمة التحليلية للنتيجة تقع هنا تحديدًا: النظام الكامل استطاع الحفاظ على المعرفة والتقدم خلال تفاعل طويل. أما توزيع الفضل بين النموذج والذاكرة والمشرف والتمثيل النصي وبقية الحلقة، فلا يمكن استخلاصه سببيًا من الأرقام المنشورة.
القيد الحاسم هو غياب الاختبار المحجوب
المجموعة العامة متاحة للفحص والتكرار والتطوير عليها، ولذلك قد يعكس الأداء مزيجًا من القدرة القابلة للنقل وهندسة محسنة للمادة المرئية. المجموعتان شبه الخاصة والخاصة تضعان النظام أمام محتوى غير متاح بالطريقة نفسها، ولهذا تحملان وزنًا أكبر عند اختبار التعميم.
غياب نتيجة محجوبة لا يلغي الإنجاز المعلن: إكمال المجموعة العامة كلها بكفاءة محسوبة يظل نتيجة قوية لنظام وكيل طويل الأفق. لكنه يمنع وصفها بأنها برهان على اجتياز ARC-AGI-3 بكامل مجموعاته، أو دليل على ذكاء عام، أو إثبات أن البنية ستحافظ على الأداء نفسه في بيئات غير مرئية.
الصورة الحالية محددة: AVO أكمل جميع المستويات العامة وسجل الدرجة القصوى في التشغيل الذي نشرته NVIDIA، بينما يظل أداؤه على التقييمين شبه الخاص والخاص مجهولًا. ولن يتغير هذا الاستنتاج إلا بنتيجة محجوبة موثقة أو بتجارب عزل تضبط الإعدادات وتفصل مساهمة مكونات النظام.
اشترك في نشرتنا الإخبارية
احصل على أحدث أخبار الويب 3 والذكاء الاصطناعي والعملات المشفرة مباشرة في بريدك.