AI dan Otomatisasi

AgentCore menilai agen lintas framework lewat OpenTelemetry

|Penulis: Tim Redaksi QUASA|4 mnt baca
AgentCore menilai agen lintas framework lewat OpenTelemetry

Pada 26 Agustus 2026, AWS menjelaskan cara Amazon Bedrock AgentCore Evaluations menilai agen lintas framework dengan membaca jejak OpenTelemetry atau OpenInference. Mekanisme itu mencakup Strands Agents, LangGraph, OpenAI Agents SDK, LlamaIndex, Google ADK, Claude Agent SDK, dan instrumentasi lain yang mengikuti konvensi yang dikenali, seperti dirangkum dalam telaah teknis ITECS.

Penjelasan tersebut bukan peluncuran awal AgentCore Evaluations: layanan itu telah tersedia secara umum sejak 31 Maret 2026. Perkembangan pada 26 Agustus memperjelas kontrak telemetri lintas framework yang memungkinkan evaluator serupa dipakai tanpa memindahkan logika penilaian ke setiap SDK.

Jejak menjadi kontrak evaluasi bersama

Sesi agen direkonstruksi dari invokasi, inferensi model, pemanggilan alat, dan respons akhir sebelum dinilai.

AgentCore tidak harus memahami state machine internal setiap framework. Layanan merekonstruksi sesi dari bukti eksekusi yang dikirim ke CloudWatch, kemudian mengenali permintaan pengguna, respons akhir, interaksi dengan model, serta pemanggilan alat.

Penjelasan arsitektur AWS membagi bukti utama itu ke dalam tiga peran span: invoke agent memuat satu siklus permintaan dan respons, inference merekam pesan yang diterima model beserta jawabannya, sedangkan execute tool membawa nama alat, parameter, dan hasil. Span retrieval, reranking, memori, atau guardrail dapat ikut berada dalam trace, tetapi bukan tiga peran inti yang dibaca untuk menyusun tindakan utama.

Aliran datanya dapat diringkas sebagai berikut:

  1. Pustaka instrumentasi menghasilkan span OpenTelemetry atau OpenInference saat agen bekerja.
  2. Pada AgentCore Runtime, AWS Distro for OpenTelemetry mengirim span dan event record ke Amazon CloudWatch.
  3. AgentCore mengelompokkan data berdasarkan sesi dan trace, lalu mengklasifikasikan span invokasi, inferensi, dan alat.
  4. Evaluator membaca sesi yang telah direkonstruksi dan menghasilkan penilaian pada tingkat sesi, trace, atau pemanggilan alat.

Satu sesi dapat memuat beberapa trace, dengan satu trace mewakili satu giliran pengguna. Karena lapisan evaluasi bekerja setelah rekonstruksi tersebut, perbedaan struktur internal SDK tidak harus menghasilkan rangkaian evaluator yang berbeda.

Dukungan framework bergantung pada konvensi

Dukungan bernama mencakup Strands Agents, LangGraph, OpenAI Agents SDK, LlamaIndex, Google ADK, dan Claude Agent SDK. Framework di luar daftar itu juga dapat dinilai melalui jalur generik, tetapi label “lintas framework” tidak berarti setiap trace arbitrer otomatis diterima.

  • OpenTelemetry GenAI: scope memakai prefiks opentelemetry.instrumentation.*, sementara peran span terutama dikenali melalui atribut operasi GenAI.
  • OpenInference: scope memakai prefiks openinference.instrumentation.*, dengan jenis seperti AGENT, CHAIN, LLM, dan TOOL untuk membedakan peran span.
  • Instrumentasi khusus: dapat memakai jalur generik jika scope, atribut pengenal, dan lokasi kontennya mengikuti salah satu konvensi tersebut.

Nama scope internal seperti mycompany.agent.tracing tidak cukup, meskipun bentuk datanya menyerupai konvensi standar. Prefix yang dikenali berfungsi sebagai penanda bahwa pustaka instrumentasi mengikuti skema yang dapat dibaca AgentCore.

Data minimum menentukan apakah sesi dapat dinilai

Validasi trace memeriksa scope, identitas operasi, korelasi sesi, isi pesan, serta data pemanggilan alat.

Dokumentasi dukungan generik AgentCore menetapkan bahwa span harus memiliki scope dan atribut pengenal yang sesuai. Dalam konvensi OpenTelemetry, gen_ai.operation.name membedakan operasi seperti invoke_agent, chat, dan execute_tool; OpenInference menggunakan openinference.span.kind.

ID trace saja tidak cukup. Span invokasi perlu menyediakan prompt pengguna dan respons agen; span inferensi memerlukan pesan masuk dan keluar; sedangkan span alat harus membawa nama, argumen, dan hasil. Semua span juga perlu dikorelasikan dengan sesi yang konsisten agar beberapa giliran dapat dirangkai menjadi satu riwayat.

Lokasi konten bergantung pada cara telemetri dikirim. Dalam mode terpisah, prompt, respons, atau pesan dapat berada pada event record yang berkorelasi; dalam mode terpadu, data itu tersimpan sebagai atribut span. Akibatnya, klasifikasi span bisa berhasil sementara evaluator kualitas respons tidak memperoleh bahan yang dibutuhkan jika hanya struktur trace yang sampai ke CloudWatch.

Pengiriman juga dapat terpotong ketika buffer span atau event record belum dikosongkan sebelum lingkungan runtime ditangguhkan. Karena kedua jenis data memakai pemroses batch terpisah, kelengkapan sesi bergantung pada terkirimnya struktur trace sekaligus konten yang berkorelasi.

Metrik tugas, respons, dan alat mengukur hal berbeda

Hasil AgentCore memisahkan pencapaian tugas, kualitas respons, penggunaan alat, dan keselamatan.

Keberhasilan tugas tidak sama dengan kualitas jawaban terakhir. GoalSuccessRate bekerja pada tingkat sesi dan memeriksa pencapaian tujuan sepanjang percakapan. Correctness serta Helpfulness bekerja pada tingkat trace, sehingga satu giliran dapat terdengar benar dan membantu meskipun tindakan yang diminta pengguna belum selesai.

Penilaian alat juga perlu dibedakan antara pemilihan alat, ketepatan parameter, dan lintasan pemanggilan. Evaluator kustom dapat menampung aturan domain atau dimensi keselamatan yang tidak diwakili oleh satu skor umum.

Dokumentasi cara kerja Evaluations menyatakan bahwa layanan dapat menghitung pencapaian tujuan ujung ke ujung, ketepatan alat, dan metrik kustom. Agen yang dinilai dapat berjalan di dalam maupun di luar AgentCore Runtime, asalkan sumber observabilitas dan akses terhadap rekaman evaluasinya dikonfigurasi.

Pemisahan tingkat penilaian mencegah skor respons diperlakukan sebagai bukti bahwa tugas benar-benar selesai. Sebaliknya, keberhasilan menjalankan alat tidak otomatis membuktikan bahwa jawaban akhir akurat, membantu, atau aman.

Batasnya tetap berada pada kelengkapan bukti

Kemampuan lintas framework berada pada lapisan telemetri, bukan pada jaminan bahwa setiap SDK menghasilkan trace lengkap tanpa konfigurasi. Implementasi tetap harus memastikan korelasi sesi, keberadaan span invokasi, ketersediaan pesan, serta konsistensi nama, argumen, dan hasil alat.

Dengan syarat tersebut terpenuhi, AgentCore Evaluations dapat menerapkan rangkaian penilaian yang konsisten pada agen dari SDK berbeda. Jika salah satu unsur hilang, layanan mungkin hanya melihat sebagian perilaku agen atau tidak dapat menyusun sesi, sehingga skor yang dihasilkan tidak mewakili keseluruhan tugas.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0