
Claudeの交渉は好みの誤読で失速、理想との差の85%を検証

Anthropicは2026年9月24日、6拠点の従業員201人がClaudeエージェントに本の交換を任せたProject Swapの 研究結果 を公開し、本人の順位で測った理論上の最良配分と取引結果の得点差の85%が、交渉より前の好みの推定誤差に由来すると示した。エージェントは交換をまとめたものの、本人が読みたい本を取り違えたままでは、交渉の成果を本人の満足につなげにくかった。
交換後の調査について、All-AIの報道 は、回答率が59%、回答者による本の満足度が10点満点中平均7.2点だったと伝える。この満足度は本を受け取った人の感想であり、交換可能な本の中から最も望ましい配分ができたかを測る得点とは異なる。Project Swapはその違いを利用し、希望の聞き取りとエージェント同士の取引を別々に評価した。
本の交換で、本人の希望と交渉をどう分けたか
参加者は手放したい本を持ち寄り、読みたい本の傾向をClaudeとの短い対話で伝えることになっていた。Claudeはその会話から、同じ拠点の交換候補を参加者ごとに順位付けした。各エージェントが取引に持ち込んだのは、この推定順位である。
別の手順では、参加者自身にも候補の本を順位付けしてもらった。この本人順位はエージェントに渡さず、結果を評価するために使った。つまりエージェントにとって有利な交換と、本人が望む交換が一致しているかを後から比べられる設計だった。
エージェントは共有のデジタル取引の場で相手を探し、交換を提案した。提案には二者間の交換に加え、複数の参加者の本を順に回す形もあり、関係する全員が同意して初めて成立する。取引の履歴は場にいるエージェントから見えたが、本人の順位までは見えない。交渉の材料となる希望が誤っていれば、取引を正しく成立させても、その誤差は残る。
85%は「失敗した交渉」の割合ではない
Claude Mediaの日本語解説 は、本人順位を提出した188人について、Claudeと本人による本のペアごとの順序が61%で一致し、本人順位から計算した最良配分の得点が0.89、Claudeの推定順位で最適化した配分を本人順位で採点すると0.60、中立的な指示で再実行した分散型取引では0.55だったと整理している。取引の得点は、受け取る本が本人の順位のどこにあるかを換算して平均した値だ。追跡調査で尋ねた満足度を同じ尺度に置き直した数字ではない。
最良配分でも全員が第一希望の本を得られるわけではない。同じ本を望む人が重なるため、交換可能な本を全体にどう割り当てるかという制約がある。そこで、本人の希望を知って配分する場合と、Claudeが推定した希望に従って配分する場合を比べると、交渉が始まる前に生じる損失が見える。
得点差を分解すると、最良配分から取引結果までの差は0.34で、そのうち推定順位を使った時点で0.29、分散型の交渉でさらに0.05下がる。前半が差の約85%に当たる。「85%」は取引が成立しなかった割合でも、参加者の大半が本に不満だったという割合でもない。見出しの失速とは、交渉を進めても本人基準の得点が理想に近づかなかったことを指す。
本人が付けた順位も、好みの完全な記録ではない。参加者は市場の本すべてではなく一部の候補を並べ、順位を付けていない本の得点は推計を含む。また、ペアごとの一致率は、二冊の優先順をClaudeが当てた割合であり、最終的に受け取った本を好きだった人の割合ではない。異なる測定値を一つの「成功率」にまとめると、今回見つかった問題の位置が見えなくなる。
モデルを強くしても、本人基準の差は残る
取引の再実行では、エージェントに使うモデルを変えると、Claude自身が作った順位に沿った配分は変わった。より強いモデルの取引は概して良い結果に近づき、強気か協調的かという指示の違いより、モデルの違いのほうが取引成績に大きく表れた。ただし、この比較で基準となるのはClaudeが推定した希望である。
本人の順位に戻して評価すると、モデル間の差は小さくなる。上位候補を獲得する交渉能力が上がっても、その「上位」が本人の希望とずれていれば、本人にとっての改善は限られる。交渉が得意かどうかと、依頼者を正しく代表できているかどうかは、別の問いとして扱う必要がある。
実験中には、ほかのエージェントを助けるため、自分の推定順位で低い本を受け入れる譲歩も見られた。市場全体には役立つ行動でも、依頼者が本当に手放したくない候補まで譲れば、本人から見た評価は変わる。交渉時の振る舞いを細かく指定しても、最初の希望の読み違いだけで結果を説明できる部分は消えない。
購買や調達への委任では、確認地点を分ける
書籍交換を代理購入や社内調達に引き直すなら、選好把握、交渉、最終確認を分けて設計するのが妥当だ。これはProject Swapの結果から導く運用上の整理であり、金銭を伴う購買でも同じ成績になると実証されたわけではない。確認を入れる地点は、エージェントが交渉を始める前と、条件を確定する前である。
- 選好把握:依頼者が何を優先し、何を受け入れられないかを、候補への判断として確かめる。少数の候補について本人が付けた順位とエージェントの推定を比べれば、誤った希望を取引へ持ち込む前にずれを見つけられる。
- 交渉:候補探し、条件提示、譲歩、合意のどこまでを任せるかを区切る。希望の推定に自信がない条件まで自動で譲歩させると、取引が成立しても依頼者の目的から離れうる。
- 最終確認:合意を確定する前に、得られる品や条件が本人の優先順位に合うかを確認する。成立した取引の記録と、現物の引き渡しや履行の確認も別に扱う。
最後の区別は実験でも現実の問題になった。本を持参しなかった参加者がいたため、取引上は本を得ても実物を受け取れない人が出た。受け渡しの記録がなく、欠けた本が最初から届かなかったのか、交換棚から持ち去られたのかも判別できなかった。希望の推定、合意、履行は、それぞれ別の失敗を起こしうる。
書籍交換から分かる範囲
今回の参加者はAnthropicの従業員で、相手も同社のClaudeを基にしたエージェントだった。取引の時間、同時に発言できる数、提案と成立の記録方法には共通のルールが設けられていた。異なる事業者のエージェントや、相手を意図的に欺く参加者が交じる市場で、同じ結果になるとは言えない。
追跡調査に答えなかった人の満足度は分からず、事前に付けた本人順位にも測定上の限界がある。書籍交換には、代金の支払い、返品、契約上の責任も含まれていない。したがって、この結果だけで購買を全面的に自動化できるとは判断できない。
公表された結果が示すのは、限定された交換市場では、交渉の改善より先に本人の希望を正確に捉えることが成績を左右した、という点だ。異なるエージェントが交じる取引や、合意後の履行まで含めた委任でどの程度の効果が得られるかは、まだ検証されていない。
関連記事:
関連記事
ニュースレターを購読
Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。




