ビジネス活用

AnthropicがR&D自動化指標を公開。Claudeが研究開発の26%を主導

Anthropicが社内の研究開発をどこまでClaudeが担っているかを測った指標を公開しました。2026年8月時点で26%の業務をClaudeが「主導」、2月時点の1%未満から急伸。測り方と、判定をClaude自身が行っているという限界まで開示されています。

Anthropicが、自社の研究開発をどこまでClaudeが担っているかを数値化した「 R&D Automation Index 」を公開しました。2026年8月時点で、社内のAI研究開発業務の26%をClaudeが「主導」しているという結果です。2026年2月時点では1%未満だったとしています。フロンティア研究所が自社の自動化率を定義付きで外に出したのは異例で、数字そのものより、測り方と限界まで書いてある点に読む価値があります。

「主導」が何を指しているか

使われているのは Epoch AI が作った AL0〜AL5 の6段階です。AL0がAIの関与なし、AL2が補助、AL3が「AIが協働する」(人の細かい指示のもとで大きな塊を処理)、AL4が「AIが主導する」(高レベルの指示から大半を最後までやり、人は監督)、AL5が完全自律にあたります。26%という数字は、AL4以上に分類された業務の割合です。

同時に公表された数字のほうが、状況をよく表しています。AL3以上、つまり「協働」以上の水準にある業務は9割を超えています。一方で、測定対象のどの領域でもAL5には達していないと明記されています。つまり、人が完全に外れた工程はまだ無い、ということです。

Claudeが「主導」する研究開発業務の割合

どう測ったのか

手順はかなり具体的に書かれています。2026年7月の各週に社員の20%を抽出し、Slackや社内文書をClaudeに読ませて、実際に行われている作業を約15,000件の粒度まで書き出しました。これを階層構造に整理して542ノード(末端は378カテゴリ)の業務一覧を作り、別のClaudeが「判定者」として各カテゴリの自動化レベルを付けています。重みづけは人の時間配分で、1人あたり1単位をその週の業務に割り振る方式です。

判定の精度も出ています。モデルの判定と人の判定が完全一致したのは59%。ただし人同士の一致は35%で、1段階以内のずれまで許せば97%が一致します。人間同士でも判定が割れる種類の作業であることが、数字として示されている形です。

一緒に出た2つの数字

自動化率だけでなく、監視と計算資源の配分も公開されています。1つ目は、2026年8月に研究・エンジニアリング用エージェントが行った10億件超の判断のうち、監視の仕組みで阻止されたのが0.002%(約4万7000回に1回)だったというもの。エージェント1体ごとに識別子を付けて生成物と紐づけ、やり取りを後から追える形で記録する設計になっているとしています。

2つ目は安全性研究への計算資源の配分です。2026年7月13日〜20日の1週間で、AI研究開発に使われた計算資源のうち約6%、AIが主導したAI研究開発に限れば約12%が安全性側に割り当てられていました。Anthropic自身が「安全性研究はその性質上、フロンティアの訓練より計算資源を食わない」と注記しており、この割合を安全性への注力度合いの指標として読むのは難しいと断っています。

日本の読者にとっての使いどころ

日本から使える製品や価格が変わる発表ではありません。効くのは、自社の「AI活用がどこまで進んだか」を説明する枠組みとしてです。多くの現場で使われている「AI活用率」「利用者数」は、使った人の数を数えているだけで、業務のどこがどれだけAIに移ったかを表しません。AL0〜AL5のような段階定義と、人の時間配分による重みづけを組み合わせる方法は、規模を落としてもそのまま真似できます。

目安になるのは、AnthropicでもAL5がゼロで、26%が「人が監督するAL4」だという構図です。 OpenAIが9月初旬に「自動研究インターン」の達成を宣言した のと合わせて読むと、フロンティア研究所ですら現状は「人が監督する前提でAIに大きな塊を任せる」段階にあることが分かります。社内で自動化の目標を立てるとき、無人化ではなく監督体制の設計に投資するほうが現実的だと考えられます。

よくある「AI活用率」とR&D自動化指標の違い
編集部作成(Anthropic公開の測定手順をもとに整理)

数字の限界も書かれている

Anthropic自身が挙げている限界は3つです。判定がClaudeに依存しているため系統的な誤りが入り得ること。業務一覧を固定して測るので、新しく生まれた種類の仕事は捉えられないこと。そして成果物の品質や効率は測っていないことです。計算資源の数字も1週間の断面で、傾向を語れるものではないとしています。

外部検証もまだです。 アモデイ氏が9月12日に提案した外部評価者の社内常駐 は、この指標の検証者としても想定されていて、複数組織の評価者を社内リスクチーム並みのアクセス権で受け入れる構想が示されています。裏を返せば、現時点の26%は自己申告です。

次の一手としては、原文の測定手順の節を読んで、自部門の業務を10〜20カテゴリに割ってAL段階を付けてみるのが早いと思います。判定が割れる業務がどこかを洗い出すだけでも、AIに任せる範囲の議論の土台になります。

出典

関連記事

ビジネス活用の記事 →