テクノロジー・イノベーション

Claudeが自社AI開発の26%を主導、ただし測定にもClaudeを使用

|著者: QUASA編集チーム|2 分で読めます
Claudeが自社AI開発の26%を主導、ただし測定にもClaudeを使用

Anthropicは2026年9月17日、同年8月時点でClaudeが自社のモデル研究開発の26%を人間の監督下で「主導」したとする試作指標を公表し、翌日の APの報道 も、26%という結果と、完全自律には至っていない点を確認した。

この26%は、全研究時間の26%をClaudeが人間抜きで処理したという意味ではない。9月18日の Quartzの整理 によれば、人間が監督するなかでClaudeが高水準の指示からタスクの大部分を一貫して完了できる領域を、投入された人員時間で重み付けした比率である。

26%の母数は、Anthropic社内のモデルR&D

Anthropic R&D Automation Indexは、AIの関与をAL0からAL5までの六段階に分類する。AL3の「協働」は人間の細かな指示の下でAIが作業の大きな部分を担う状態、AL4の「主導」は人間が高水準の指示を出して監督し、AIがタスクの大部分を最初から最後まで進める状態だ。AL5は人間を作業の輪に置かない「完全自律」を指す。

  • 支援:AIが人間の作業の一部を補助する。
  • 協働:人間の密接な指示を受けながら、AIがまとまった作業を担う。
  • 主導:人間の監督を残しつつ、AIが高水準の指示からタスクの大部分を完了する。
  • 自律:人間が介在せず、AIがタスクを遂行する。

26%はAL4に分類された仕事の人員時間加重比率であり、AL5の比率ではない。協働以上に当たるAL3以上は90%を超えたが、完全自律と判定された測定領域はゼロだった。したがって、「Claudeが研究開発のほぼすべてを単独で行う」「研究者の26%を置き換えた」といった解釈は、この指標からは導けない。

対象範囲も限定されている。測定したのは、Claudeの利用を前提に工程や社内ツールを整えているAnthropic自身のモデルR&Dであり、一般企業のソフトウェア開発、日本市場、AI業界全体の自動化率ではない。共通の分類方法がない現状では、26%を他社の数値と直接比較することもできない。

約1万5000件の作業から542ノードを構築

Anthropicの方法論 では、2026年7月の各週にモデルR&Dを構成する各部門から従業員の20%を無作為抽出し、Claudeの調査エージェントがSlackと社内文書から各人の1週間分の仕事を調べた。そこで得た約1万5000件の細かなタスクをClaudeが階層化し、542ノードの体系を作成したうえで、そのうち378ノードを末端カテゴリーとした。

これは全社員の全行動を直接記録した台帳ではなく、部門別・週別の標本から社内業務の構造を推定する方法だ。一方、単にClaudeが関与した会話数や生成コードの行数を数えるのではなく、訓練、プロダクト、事前学習、強化学習など、モデル開発を構成する仕事の種類ごとに自動化水準を評価できる。

作成した542ノードの体系は固定され、各月を同じ「仕事のかご」で比較する。既存の仕事がどこまで自動化されたかを追いやすい反面、AIの導入によって新しい種類の仕事が生まれたり、人間が別の仕事へ移ったりした変化は、指数だけでは捉えにくい。

集計時の重みには、各仕事へ投じられた人員時間の近似値を使う。従業員一人に1週間当たり1単位を与え、その週に四つのタスクを担当していれば各0.25、十のタスクなら各0.10として配分する仕組みだ。そのため26%はタスク件数の比率ではなく、人員時間で重み付けされた仕事の構成比となる。

作業の抽出も判定もClaudeが担う

測定上の最大の注意点は、Claudeが開発作業だけでなく指数の作成にも組み込まれていることだ。最初の作業一覧を作る調査エージェント、約1万5000件のタスクを階層へ整理する処理、各ノードについて担当者や利用ツール、AIの関与範囲を調べる処理にClaudeが使われた。

さらに、集められた証拠を別のClaude判定役が読み、各ノードをAL0からAL5のいずれかに分類した。過去の月を評価する際は、その月より後の証拠を調査エージェントに見せない設計だが、評価対象と判定モデルが似た誤りや判断傾向を共有する可能性は残る。26%は外部監査で確定した客観的な自動化率ではなく、自社資料と自社モデルを使った試作指数の結果として読む必要がある。

人間による照合では、担当領域の社員がClaudeの証拠や判定を知らされずに自動化水準を評価した。Claudeと人間の判定が完全に一致した割合は59%、人間同士では35%で、Claudeと人間の判定の97%は一段階以内に収まった。ただし、一段階の違いでも「協働」と「主導」の境界をまたげば、26%に含まれるかどうかが変わる。

人員時間による重み付けにも範囲がある。多くの人が時間を費やすカテゴリーほど指数への影響は大きくなるが、計算資源、研究成果の質、技術的な難易度、戦略的重要性を直接測ってはいない。作業時間が短くなったことや、新しいモデルの性能が向上したことを示す生産性指標でもない。

示されたのは自律的な自己改良ではなく、監督下での主導拡大

今回の結果が示すのは、Claudeの役割が局所的な補助だけでなく、人間の監督下でまとまった研究開発タスクを進める段階まで広がったとAnthropicの社内指標が判定したことだ。AIが次世代AIの開発に関わる度合いを、作業カテゴリーと人員時間を用いて継続測定しようとした点にも新規性がある。

一方、この指数だけでは、研究速度が26%上昇した、必要な研究者が26%減った、成果の質が同じ割合で改善したとは言えない。Claudeが自ら研究課題を設定し、結果を検証し、次の開発方針を人間なしで決める状態も確認されていない。「主導」は強い表現だが、その定義には人間の指示と監督が明示的に残っている。

現時点で確認できるのは、2026年8月のAnthropic社内のモデルR&Dを同社の方法で分類すると、人員時間加重でAL4が26%、AL3以上が90%超、AL5がゼロだったという範囲までである。この変化が研究成果や開発速度へどれだけ結び付くかを判断するには、同じ分類体系による継続データと、Claude以外のモデルまたは第三者による再現検証が必要になる。

共有:

ニュースレターを購読

Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。

0