AgentCore अब कई AI ढाँचों को एक कसौटी पर मापेगा—ट्रेस सही होना जरूरी

AWS ने 26 अगस्त 2026 को Amazon Bedrock AgentCore Evaluations के लिए ढाँचा-स्वतंत्र मूल्यांकन पथ घोषित किया। AWS की तकनीकी घोषणा के मुताबिक, सेवा LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK और Strands Agents से निकली संगत OpenTelemetry या OpenInference टेलीमेट्री पर समान मूल्यांकनकर्ता लगा सकती है।
27 अगस्त को प्रकाशित AIToday की स्वतंत्र पुष्टि ने भी विस्तारित ढाँचा समर्थन और इसकी दो मुख्य शर्तें दर्ज कीं: स्पैन का session.id सही सत्र से मेल खाए और संदेश सामग्री उपलब्ध हो। इसलिए साझा मूल्यांकन पथ का अर्थ अपने-आप निष्पक्ष तुलना नहीं है; परिणाम उस प्रमाण पर निर्भर रहेगा जो हर ढाँचा अपने ट्रेस में दर्ज करता है।
AgentCore ढाँचे के बजाय दर्ज व्यवहार को पढ़ता है

AgentCore Evaluations किसी एजेंट के आंतरिक ग्राफ या प्रोग्रामिंग ऑब्जेक्ट की सीधी तुलना नहीं करता। सेवा CloudWatch से स्पैन और उनसे जुड़े घटना अभिलेख लेकर सत्र बनाती है, फिर लक्ष्य-पूर्ति, उत्तर की शुद्धता, उपयोगिता और कस्टम माप जैसे मूल्यांकनकर्ता उस दर्ज व्यवहार पर चलाती है।
इसके लिए तीन भूमिकाएँ केंद्रीय हैं। invoke agent स्पैन उपयोगकर्ता के एक अनुरोध और एजेंट के अंतिम उत्तर को रखता है; inference स्पैन मॉडल को मिले संदेशों और उसके उत्तर को दर्ज करता है; execute tool स्पैन औजार का नाम, इनपुट और परिणाम बताता है। पुनर्प्राप्ति, मेमोरी, सुरक्षा-जाँच और पुनःक्रम निर्धारण के स्पैन अतिरिक्त संदर्भ दे सकते हैं, लेकिन इन तीन भूमिकाओं से सेवा मूल्यांकन योग्य संवाद और औजार-क्रम दोबारा बनाती है।
यहीं “एक कसौटी” की सीमा स्पष्ट होती है। समान मूल्यांकनकर्ता अलग ढाँचों पर लगाया जा सकता है, पर यदि एक ट्रेस पूरा औजार परिणाम रखता है और दूसरा केवल औजार का नाम, तो दोनों को मिला समान अंक समान प्रमाण पर आधारित नहीं होगा।
न्यूनतम ट्रेस अनुबंध में छह जाँच जरूरी हैं

AWS का सामान्य ढाँचा समर्थन दस्तावेज बताता है कि सेवा स्कोप नाम, पहचान विशेषताओं और तय सामग्री क्षेत्रों से स्पैन को वर्गीकृत करती है। किसी अनाम या अपने ढंग से लपेटे गए संदेश को सेवा ढाँचे के मूल डेटा मॉडल के अनुसार खोलने की कोशिश नहीं करती; वह उपलब्ध मान को निर्धारित क्षेत्रों से निकालती है।
- मान्य स्कोप: सामान्य समर्थन के लिए scope.name को opentelemetry.instrumentation.* या openinference.instrumentation.* उपसर्ग अपनाना होगा। केवल उपसर्ग से मेल खाने वाला बुनियादी ढाँचा स्पैन पर्याप्त नहीं है; AWS कुछ HTTP, वेब ढाँचा और SDK स्कोप को गलत एजेंट स्पैन बनने से रोकने के लिए बाहर रखता है।
- स्पैन की पहचान: OpenTelemetry में gen_ai.operation.name अथवा उसका दर्ज वैकल्पिक क्षेत्र और OpenInference में openinference.span.kind बताता है कि स्पैन एजेंट, मॉडल या औजार की किस भूमिका में है। मान्य पहचान न होने पर स्पैन छोड़ा जा सकता है।
- सत्र का मेल: संबंधित स्पैन का session.id एजेंट को बुलाते समय प्रयुक्त runtimeSessionId से मेल खाना चाहिए। बेमेल पहचान अलग अनुरोधों को एक सत्र में जोड़ने से रोकती है।
- संवाद की जड़: प्रत्येक उपयोगकर्ता lượt के लिए शीर्ष-स्तरीय एजेंट स्पैन होना चाहिए। केवल मॉडल-कॉल का बिखरा इतिहास पूरे अनुरोध और अंतिम एजेंट उत्तर का भरोसेमंद विकल्प नहीं है।
- संदेश और औजार सामग्री: उपयोगकर्ता अनुरोध, मॉडल को मिला इतिहास, अंतिम उत्तर, औजार का नाम, उसके तर्क और परिणाम दस्तावेज में बताए क्षेत्रों या संबद्ध घटना अभिलेखों में होने चाहिए। निजी आवरण में बंद या हटाई गई सामग्री मूल्यांकनकर्ता को अलग प्रमाण देगी।
- पूरा निर्यात: स्पैन और संदेश रखने वाले घटना अभिलेख दोनों CloudWatch तक पहुँचने चाहिए। केवल समय, नाम और पहचान वाले स्पैन से उत्तर की शुद्धता या औजार चयन नहीं परखा जा सकता।
ऑनलाइन और मांग-आधारित अंक अलग संदर्भ रखते हैं

AgentCore के मूल्यांकन प्रकारों में ऑनलाइन व्यवस्था तैनात एजेंटों के वास्तविक यातायात से सत्रों का नमूना लेकर लगातार गुणवत्ता देखती है। मांग-आधारित व्यवस्था चुने हुए स्पैन या ट्रेस पर केंद्रित जाँच चलाती है, जबकि बैच मूल्यांकन कई सत्रों को एक काम में संसाधित कर समेकित और प्रति-सत्र परिणाम देता है।
मांग-आधारित या बैच परीक्षण में नियंत्रित प्रश्नों के साथ संदर्भ उत्तर और अपेक्षित औजार-क्रम रखा जा सकता है। उत्पादन यातायात में वैसा संदर्भ सामान्यतः मौजूद नहीं होता, इसलिए समान नाम वाला मूल्यांकनकर्ता भी अलग प्रश्न-संग्रह, संदेश इतिहास या कार्य-वितरण पर अलग संदर्भ का अंक देगा। ढाँचों की तुलना करते समय मूल्यांकनकर्ता के साथ परीक्षण-संग्रह, मॉडल विन्यास, सामग्री-संरक्षण नियम और ग्राउंड ट्रुथ भी समान रखना होगा।
ग्राउंड ट्रुथ उपयोगी है, लेकिन पूर्ण सत्य नहीं
AWS के ग्राउंड ट्रुथ दस्तावेज में expectedResponse को अपेक्षित उत्तर, assertions को सत्र-स्तरीय व्यवहार और expectedTrajectory को औजारों के अपेक्षित क्रम से जोड़ा गया है। हर मूल्यांकनकर्ता इन सभी क्षेत्रों का उपयोग नहीं करता; अनुपयोगी क्षेत्र परिणाम में अलग से बताए जा सकते हैं।
ग्राउंड ट्रुथ टीम द्वारा चुना गया संदर्भ है, वास्तविक दुनिया का स्वतः सिद्ध सत्य नहीं। यदि दो ढाँचों के परीक्षणों में अपेक्षित उत्तर, व्यवहार कथन या औजार-क्रम अलग हैं, तो एक जैसे अंक भी एक ही प्रश्न का उत्तर नहीं दे रहे होंगे। ग्राउंड ट्रुथ क्षेत्रों वाले कस्टम मूल्यांकनकर्ता ऑनलाइन विन्यास में नहीं चल सकते, क्योंकि वास्तविक उत्पादन सत्रों के साथ वे संदर्भ उपलब्ध नहीं होते।
अभी पुष्टि यह है कि AgentCore Evaluations छह नामित एजेंट ढाँचों और दो मान्य टेलीमेट्री परंपराओं का पालन करने वाले अन्य एजेंटों को साझा मूल्यांकन पथ देता है। घोषणा किसी साझा डेटा-संग्रह पर इन ढाँचों का मानक-परीक्षण परिणाम नहीं देती; वह मापन का अनुबंध देती है। इसीलिए अगली विश्वसनीय तुलना का आधार अंक से पहले सही स्कोप, जुड़ा सत्र, पूरी संदेश सामग्री और समान संदर्भ शर्तें होंगी।
हमारे न्यूज़लेटर की सदस्यता लें
Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।