
A Claude-ágensek jól alkudtak, de csak 61%-ban értették a gazdájukat

Az Anthropic 2026. szeptember 24-én közzétett Project Swap-kutatása szerint a vállalat 201 munkatársa hat irodában bízta Claude-ágensre egy könyv elcserélését; a rövid beszélgetésből összeállított ágensrangsor a résztvevők könyvpár-választásaival 61%-ban egyezett, míg a véletlen sorrend 50%-ot ért volna el. Az ágensek ezután közös digitális piactéren egyezkedtek egymással. A kísérletben az alku működött, de a pontatlanul felismert ízlés korlátozta, hogy az emberek milyen könyvet kaptak.
A Model Current elemzése szerint a semleges utasításokkal megismételt decentralizált piac a résztvevők saját rangsorával mérve 0,55-ös átlagot ért el a számított 0,89-es optimumhoz képest; még a Claude becsült rangsorából kiinduló legjobb kiosztás is csak 0,60-at hozott volna, így a különbség 85%-át a preferenciák pontatlan becslése magyarázta. Ez a kétféle teljesítmény közötti lényegi eltérés: az ágens eredményesen tárgyalhat arról a célról, amelyet neki adtak, miközben az a cél csak részben fedi az ember kívánságát.
Hogyan jutott el az olvasó kívánsága az ágenshez?
Minden résztvevő egy továbbadni kívánt könyvet hozott, majd röviden elmondta Claude-nak, mit szeret olvasni és milyen könyvnek örülne. A rendszer a beszélgetés alapján sorrendbe állította a helyi készletet. Ezt a becsült sorrendet kapta meg az ágens, amely a résztvevő nevében ajánlatot tehetett, elutasíthatott egy javaslatot, vagy több szereplőt érintő cserét szervezhetett. Megállapodás csak az érintett ágensek beleegyezésével jöhetett létre.
A kutatók az emberektől külön is kértek könyvrangsorokat, amelyeket az ágensek nem láttak. Így meg tudták különböztetni a tárgyaláshoz használt, Claude által becsült ízlést attól, amit a résztvevők maguk mondtak a könyvekről. A módszer azért fontos, mert egy létrejött csere önmagában keveset árul el a képviselet minőségéről: az ágens elérheti a saját listáján előkelő helyen álló könyvet akkor is, ha az olvasó hátrébb sorolta volna.
Két mérce, két különböző hiba
- Az ízlés felismerése: a páronkénti egyezés azt mutatja, hogy két könyv közül Claude ugyanazt helyezte-e előrébb, mint az olvasó. Ez a rangsorok összevetése, nem annak mérése, hogy az ágens a résztvevők mekkora részét „értette meg”.
- Az alku eredménye: a piactéri pontszám azt méri, hol állt a megszerzett könyv az ember saját sorrendjében. A legjobb lehetséges kiosztás sem adhatja mindenkinek az első választását, mert ugyanazt a könyvet többen is szerethetik.
A két mérce közé illeszkedik egy számított köztes helyzet: milyen eredmény születne, ha a könyveket a lehető legjobban osztanák el, de a döntéshez csak az ágensek által becsült sorrendeket használnák. Ebben a helyzetben az alkudozás súrlódása eltűnik, az ízlésre vonatkozó tévedés viszont megmarad. A tényleges piactér és ez a kiosztás közötti kisebb eltérés ezért más problémáról szól, mint az emberi preferenciák alapján számított legjobb eredménytől való távolság.
A különbség nem pusztán statisztikai finomság. Ha valaki egy csere eredményét kizárólag az ágens saját listájához méri, a rendszer sikeresnek látszhat akkor is, amikor a résztvevőnek közepesen tetsző könyvet szerez. Az emberi rangsor bevonása megmutatja, hogy az alku során elért nyereségből mennyi jutott el ahhoz, akinek a nevében az ágens eljárt.
Mit változtatott az erősebb modell?
A kutatók a piactereket más modellekkel és eltérő tárgyalási utasításokkal is újrafuttatták. Claude becsült rangsorához viszonyítva az erősebb modellek általában jobb csereeredményt értek el; az utasítások közötti eltérés kisebb volt. Amikor viszont ugyanazokat az eredményeket az emberek saját rangsora alapján nézték, a modell- és utasításválasztás előnye sokkal kevésbé rajzolódott ki.
Ez nem teszi jelentéktelenné a tárgyaló ágens képességeit. Inkább azt mutatja meg, hogy a jobb végrehajtás hatása a cél leírásának pontosságától függ. Az az ágens, amelyik ügyesebben szerez meg egy általa nagyra értékelt könyvet, nem feltétlenül javít ugyanennyit a résztvevő tényleges eredményén. A könyvpiac ezért ritka lehetőséget adott arra, hogy a cél felismerését és a cél érdekében végzett alkut ugyanabban a kísérletben, külön is értékeljék.
Meddig ér a könyvpiac tanulsága?
A részletes kutatási jelentés szerint az ízlés összevetéséhez 188 résztvevő rangsora állt rendelkezésre, a későbbi kérdőívre pedig a munkatársak 59%-a válaszolt; egyikük a könyvválasztás bizonytalanságát így fogalmazta meg: „I don't even fully know what I want when it comes to books”. Az ember saját rangsora szükséges viszonyítási pont, de egy adott olvasmány iránti kedvét ő maga sem mindig tudja előre pontosan megfogalmazni.
- Minta: valamennyi résztvevő az Anthropic munkatársa volt. A Claude iránti bizalmuk és az ágensekkel szerzett tapasztalatuk nem feltétlenül jellemző más olvasókra.
- Tét: a résztvevők könyvet cseréltek. Egy rossz választás következménye nem hasonlítható pénzügyi, munkaügyi vagy egészségügyi döntéséhez.
- Piaci környezet: az ágensek ugyanazon vállalat modelljeire épültek, rögzített szabályok között tárgyaltak, és a kísérlet nem vizsgálta a megtévesztő ellenfelek hatását.
A könyvcsere legközvetlenebb következménye a döntéstámogatás értékelésére vonatkozik. Az ágens által kötött kedvező üzlet csak akkor jelent az embernek is kedvező eredményt, ha a rendszer megfelelően képviseli a választási szempontjait. Nagyobb tétű feladatoknál külön vizsgálatot igényel majd, hogyan lehet ezt még az önálló döntés előtt megbízhatóan megállapítani.
Kapcsolódó cikkek


LangSmith, Phoenix vagy Langfuse: nem ugyanazt méri mindhárom

Billingo vagy Számlázz.hu: az API és a számlamennyiség dönti el

A 50skills 6 millió dollárt kapott, de az eredmények még önbevallásosak

A hallucinációs arány kevés: így mérd külön a RAG hibáit

EV vagy kft: a 3 milliós tőke nem az egyetlen választóvonal
Iratkozzon fel hírlevelünkre
A legfrissebb Web3-, MI- és kriptohírek egyenesen a postafiókjába.