
SalesforceのCRM特化AI「Koa」、強みは万能性能ではなく複数手順

SalesforceとNVIDIAは2026年9月15日、サンフランシスコのDreamforce 2026で、Agentforce向けCRM推論モデル「Koa」を発表した。CIOの同日報道 も、Salesforce初のCRM特化型推論モデルとして発表を確認している。
Koaとは、汎用チャットAIを全面的に置き換えるモデルではなく、情報の取得、条件判断、CRMレコードの更新など、複数のツールを順番に使う業務に照準を合わせたモデルだ。同日の Salesforceの公式発表 では、選定顧客向けのパイロットとしてAgentforceで提供中で、米国リージョンでの一般提供は2026年冬を予定しているほか、同社のCRM評価で主要モデルと同等以上の性能を3分の1のエラーで実現したと説明している。
Nemotronを業務仕様から追加学習
Koaの基盤は、NVIDIAのオープンウェイトモデルNemotron-3-Super-120Bである。完成済みモデルをそのままAgentforceへ組み込むのではなく、CRM業務の構造から合成した課題を使い、必要な機能を選んで処理を完了する能力を強化した。
9月14日公開の技術論文 によると、学習には公開データと合成データだけを使い、Salesforceの顧客データは使用していない。強化学習にはGroup Relative Policy Optimization(GRPO)を採用し、Agentforceエージェントを定義する宣言型言語「Agent Script」の仕様から、ルーター、サブエージェント、利用可能なアクション、引数、終了条件を含む実行可能な課題を構成した。
学習時の評価対象は、自然な文章を返せたかだけではない。依頼に必要なツールを呼び出し、データに依存する回答を実行結果に基づいて返し、所定の状態まで処理を進められたかが報酬になる。Koaの専門性はCRM知識の暗記量よりも、業務仕様に沿って一連の操作を完結させる訓練にある。
顧客データを学習に使わないことと、稼働中のエージェントが許可された顧客情報を処理することは別の論点だ。Koaの重み、追加学習、推論はSalesforceの管理境界内に置かれるが、個々の導入環境で参照できるデータや実行可能なアクションは、Agentforce側の権限設定に左右される。
三つの評価で見える性能の境界
開発チームは、複数ターンの顧客対応を扱うTau2Bench、エージェントのツール利用を測るBFCL、単一ターンのSalesforceおよびAgentforce業務を扱うCRM Benchで比較した。KoaはTau2Benchのタスク加重平均で69.41、BFCLで66.63%、CRM Benchで0.86となり、基盤モデルの68.64、64.73%、0.84をそれぞれ上回った。CRM Benchの関数呼び出し精度も0.71から0.77へ上がった一方、トピック判定は0.97、自由記述は0.85で基盤モデルと同じだった。
この結果は、専門化によってあらゆる能力が一様に伸びたことを意味しない。改善が明確なのはツール利用、とりわけ会話や状態の変化をまたぐ処理であり、単発の分類や自由記述では差が出ていない。
最上位モデルとの差も残った。GPT-5.5はTau2Benchで83.99、CRM Benchで0.90、Claude Opus 4.8はBFCLで78.18%を記録し、それぞれKoaを上回った。Koaは比較対象のGPT-4.1を三つの総合指標すべてで上回ったが、「CRM特化だから常に最高性能」と結論づけられる結果ではない。
「エラー3分の1」だけでは比較条件が分からない
公式発表が掲げるエラー削減は印象的だが、公開ページには比較対象、エラーの定義、試行数、各モデルの母数が示されていない。CRM Benchの総合値だけから同じ比率を再計算することもできないため、モデル選定では内訳と条件が公開された三つの評価を分けて見る必要がある。
Tau2Benchは航空、小売、通信の顧客対応を対象とし、GPT-4.1を利用者役のシミュレーターに使った4回の試行平均である。BFCLは複数段階の関数呼び出し、ウェブ検索、メモリー、状態を持つツールなどを含み、CRM Benchはトピック判定、関数呼び出し、自由記述を合成した評価だ。異なる課題を一つの「CRM性能」にまとめると、Koaが改善した領域を見誤る。
さらに、掲載値はSalesforceの開発チームによる評価であり、独立機関の追試や顧客環境での運用結果ではない。実際のAgentforceでは企業ごとにデータ構造、権限、独自アクション、終了条件が異なるため、公開ベンチマークの順位をそのまま業務上の成功率へ読み替えることはできない。
Agentforceで担うのは長い業務手順
Koaが想定するのは、質問へ一度答えて終わる処理より、途中で情報を取得し、条件を判断し、別のアクションへ進む仕事だ。公式に例示された商談の更新、ケースの振り分け、フォローアップの設定も、正しい対象や条件を確認してからCRMの状態を変更する点で、文章生成だけでは完結しない。
導入時の比較軸は三つに分けられる。単発のCRM処理では最上位モデルを超えておらず、複数ターンのツール利用では基盤モデルからの改善が見える。運用面では、顧客データを学習に使わずSalesforce管理下で推論する設計が示されたものの、各社固有のアクセス制御や正答率を保証するものではない。
したがってKoaの位置付けは、一般知識や幅広い推論で汎用モデルを置き換えることではない。AgentforceがCRMの状態を更新しながら複数手順を進める場面に、Salesforce自身が管理する特化モデルという選択肢を加えることにある。
一般提供後も独立評価と地域展開が焦点
現時点で確認できる提供範囲は、Salesforce社内での利用と選定顧客によるパイロットまでだ。米国以外での提供時期、料金、対象となるAgentforce製品、利用者がモデルを選択できる条件は、今回の公開資料では明らかにされていない。
KoaはNemotron-3-Super-120BをCRM向けに追加学習し、公開評価では基盤モデルより良好なツール利用を示したが、最上位の汎用モデルを全面的に上回ったわけではない。一般提供後に、企業ごとの権限設計や独自アクションを含む長期タスクで、成功率や誤操作がどう変化するかを示す実運用データと独立評価が、専門モデルとしての実効性を判断する次の材料になる。
関連記事
ニュースレターを購読
Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。




