「なるほど、これをうちでもやろう」では遅い——Anthropicの指標をどう読むか

"We Should Do That Too" Is Already Too Late — How to Read Anthropic's Metrics for the Pace of AI Development

著:霧星礼知(min.k)|mncc.info / Author: Reichi Kirihoshi (mncc.info)


はじめに

Anthropicが、フロンティアAI開発の進み具合を外から把握するための測定方法を公開した[1]。AIがAI研究開発のどれだけを担っているか、AIエージェントの行動をどこまで監督できているか、計算資源を何に配分しているか。この三つである。

読んで最初に思ったのは、「ずいぶん当たり前のことを測っているな」ということだった。

誰が仕事をしているのか。それを誰が見ているのか。資源をどこに使っているのか。これらはどの組織でも気にしているはずのことだ。

しかし、読み進めると、この当たり前のことを測れる形にするまでの手間のほうに目が行くようになった。業務をどう数え上げたか、どこに線を引いたか、どこで迷ったか。記事の後半は、ほとんどが方法論の説明に使われている。

さらにもう一つ考えたのは、この物差しを日本企業、とくにSIの現場に当てたらどうなるか、ということだった。

1. Anthropicが公開した三つの指標

①AIがAI研究開発のどこまでを担っているか

一つ目は、社内のAI研究開発のうちどれだけをClaude自身が担っているかを表す指標で、Anthropic R&D Automation Indexと名付けられている。

段階の区分には、Epoch AIが提案したAutomation Level(AL)を使っている[2]。

  • AL0:AIの関与なし
  • AL1:最小限の関与
  • AL2:AIが支援する
  • AL3:AIと協働する
  • AL4:AIが主導する
  • AL5:完全に自律して動く

差が大きいのはAL3とAL4の間だ。Anthropicは、夜間のデータパイプラインが壊れた場面を例に挙げている。AL3では、エンジニアが失敗ログを持ってきて仮説を話し、途中で別の問題が見つかればClaudeは手を止めて判断を仰ぐ。AL4では、エンジニアは障害アラートを渡して直すよう頼むだけで、Claudeがログを読み、原因を特定し、修正と検証をして、何が起きたかを書き上げる。人間は報告を読み、今夜出すかどうかを決める[3]。

見ているのは、仕事の主体がAIと人間のどちらにあるかだ。

2026年8月時点で、AnthropicのAI研究開発のうちAL4に当たる作業は26%、AL3以上は90%を超えた。AL5に該当する業務はまだない。AL4の比率は、2026年2月の時点では1%未満だったという[4]。

②AIエージェントをどこまで監督できているか

二つ目は監督の指標だ。AnthropicではAIエージェントに長時間の作業を任せ、エージェント同士が仕事を渡し合うようになっている。任せる量が増えれば、任せた仕事を把握できているかが問題になる。

測っているのは三つある。

  • coverage:エージェントの行動のうち、監視を通っている割合
  • review latency:行動からレビューまでの時間
  • escalation rate:ブロックされる、あるいは追加レビューに回される割合

2026年8月時点で、最もよく使われている社内プラットフォームでは、常時およそ3万のエージェントが研究・エンジニアリング作業をしていた。その行動はすべて実行前にリアルタイムの監視を通り、8月の10億件を超える判断のうち0.002%(約4万7千件に1件)がブロックされた。ブロックされたものは1週間以内に人間が確認する。事後の監視は週に約10万件のトランスクリプトを拾い、分類器による確認を経て、人間のレビューに上がるのは週50件ほどだという[5]。

③計算資源を何に使っているか

三つ目は計算資源の配分だ。2026年7月13日から20日までの1週間を切り出し、すべてのワークロードを分類した。AI研究開発向けのcomputeのうち安全関連の研究に使われたのは約6%、AI主導のAI研究開発に限ると約12%だった[6]。

Anthropic自身、この数字の限界を書いている。安全研究はもともと大規模な学習ほど計算を使わない。安全用の分類器が効率化すれば比率は下がるが、安全の仕事が減ったわけではない。1週間分では傾向も言えない。それでも測るのは、同じ定義で時系列や他社と比べられるからだとしている[6:1]。

2. なぜ今、これを測るのか

AIがAIを「作り始めている」ため

この発表を読むうえでは、指標の中身より、なぜ今それが必要になったかのほうが重要だと思う。

Anthropicは別の資料で、AIが自分自身の開発工程を担う割合が急速に増えていることを示している。2026年5月時点で、同社のコードベースにマージされるコードの80%超はClaudeが書いたもので、2026年第2四半期にエンジニア一人が1日にマージするコードの行数は2024年の約8倍になった。行数は品質を表さないので実際の生産性向上より大きく出ている、という注記つきである[7]。

AIがAIを作る割合が増えれば、人間がその工程を理解できているかが怪しくなる。 モデルが何をできるかは能力評価で測れるが、モデルがどのように作られ、その過程を人間がまだ見ていられるかは、能力評価では分からないのだ。Anthropicは今回の指標を、能力評価を補うもの、モデルの「生産工程」を見るためのものと位置づけている[8]。

外から検証できる形にするため

見落としやすい目的がもう一つある。Anthropicはこれらの数字を、一般の人々や第三者、政府がフロンティアAI開発の速度を把握できるようにするために公開している。第三者の評価者を社内に受け入れ、こうした指標を監視させる計画にも触れている[9]。

そのため各指標には「どの開発者でも今日から報告できること」という項目があり、方法論の公開と他社との比較が前提になっている。社内をうまく回すためのKPIとは、設計の出発点が違う。

三つの指標を並べると、問いは一つにまとまる。AIが仕事の主体になっていくとき、人間はまだ状況を把握し、介入できるのか。自動化度、監督、資源配分は、その問いを三方向から数えたものだ。

3. 一般企業の業務に当てはめる

業務を分解して段階をつける

この考え方は、AI研究所でなくても使える。

Automation Levelを一般企業に当てるなら、社員がAIを使っているかを数えても得られるものは少ない。業務のどこまでをAIが自走できているかを見る。SIerなら、たとえば次のように分解できる。

  • 要件整理
  • 設計
  • コード生成
  • 設計レビュー
  • テスト設計
  • ログ解析
  • 障害の一次切り分け
  • 手順書作成
  • パラメータシート作成
  • 顧客説明資料の作成

一つずつにALをつけていけば、「AI活用率〇%」という数字よりずっと多くのことが分かる。パラメータシートはAL4に近いのに、顧客説明資料はAL1のまま、といった凸凹が見えてくる。

止まっている理由を分ける

段階をつけたら、そこで止まっている理由も記録しておきたい。

  • AIの能力が足りない
  • セキュリティ上の理由でできない
  • 顧客との契約でできない
  • 権限が与えられていない
  • 昔から人間がやっている

同じAL1でも、理由によって打ち手はまるで違う。能力不足なら半年待てば解消するかもしれない。契約が理由なら営業と法務の話になる。最後の理由がいちばん多いのではないかと思っているが、これは測ってみないと分からない。

測り方の苦労も読む

自社で測ろうとする人にとっては、Anthropicの付録のほうが本文より役に立つだろう。

業務の一覧は、人が思い出して書き出したものではない。2026年7月の各週に、研究開発に関わる各部署から社員の20%を抽出し、その週の作業をClaudeにSlackや社内文書から洗い出させて、約1万5千件のタスクを集めた。それを542ノード、うち末端378の木構造に整理し、以後の測定はこの固定した木に対して行う。各タスクの重みは、そこに割かれた人の時間で決めている[10]。

判定の揺れについても書かれている。モデルの判定と担当者の判定が完全に一致したのは59%、担当者同士では35%だった。1段階以内のずれまで含めると、モデルと人間は97%で一致した。AL3がどこで終わりAL4がどこから始まるかは、人間同士でも意見が分かれる[11]。

自社でやっても、同じところで揉めるはずだ。**業務の一覧を最初に固定しないと、測るたびに対象が変わって比較できない。重みをつけないと、年に一度の作業と毎日の作業が同じ扱いになる。**境界の判定がぶれることは、最初から織り込んでおいたほうがいい。

4. 企業での監督能力は「足りなくなる」

レビューが次のボトルネックになる

自動化度だけを追っていると、AIに任せる量が増えるほど数字が良く見える。多くのAI導入がはまるトラップだ。監督の指標は、その裏側を見ている。

Anthropicは、コード生成が速くなった結果、人間のコードレビューが新しいボトルネックになったと書いている。一部を速くしても、全体の速度は速くならなかった部分に制約される。コンピュータのアムダールの法則を組織に当てはめた話だ[12]。

SIでも同じことが起きる。AIが設計書を10分で書けるようになっても、レビューする人の時間が変わらなければ、納期はたいして縮まない。レビューを通さずに出せば速くなるが、それは監督のcoverageを下げたということになる。

SIでは監督コストが見落とされる

一般企業向けに読み替えると、次のような問いになる。

  • AIが作った成果物のうち、人間がレビューしている割合はどれくらいか
  • 問題のある出力が、どれくらいの時間で見つかっているか
  • AIの出力が差し戻されたり、上位者に上がったりする割合はどれくらいか

これを自動化度と並べると、自動化が健全に進んでいるかが見えてくる。自動化度が上がり、coverageが下がり、差し戻し率は誰も把握していない。そういう状態でも「AI活用が進んでいる」と報告されることはある。

5. AIの計算資源を「人時」と「予算」に読み替える

有限な資源がどこに行っているかを見る

一般企業に大規模なGPUクラスタはない。それでも、有限な資源をどこに配分しているかという見方はそのまま使えるだろう。計算資源そのものの代わりに、人時、AI関連予算、API利用額、ライセンス費、PoC予算、検証環境、AI教育の時間、業務の再設計に割ける時間を数えればいい。

「生成AI推進」を掲げながら、社員の時間のほとんどが既存業務の維持に使われ、業務の再設計にはほとんど時間が与えられていない会社がある。AI予算のほとんどがライセンス購入に消え、業務分析や自動化の設計には回っていない会社もある。こういった方針と配分の食い違いは、配分を数えればすぐに分かる。

分類の線を先に引いておく

Anthropicは、安全研究と能力向上の研究を区別するのが難しいことも書いている。どの開発者も線を広めに引きたくなるので、その作業が安全関連だと示す責任は開発者の側に置くべきだとし、定義を前もって揃えておくことを求めている[13]。

企業の「DX予算」や「業務改善の時間」でも同じことが起きる。既存システムの保守をDXと呼べば、DX比率はいくらでも上がる。何をAI活用や業務再設計に数えるのかを先に決めておかないと、配分の数字は報告のための数字になる。

6. SIerの制約と自動化

任せられないこと、自動化できないこと

SIには制約が多い。顧客環境、セキュリティ、契約、権限、監査、個人情報、システムごとの運用ルール。全部をAIに任せるのは現実的でない。

ただ、全部は任せられないことと、自動化できないことは同じではない。制約の中でも、ログ解析、設定差分の整理、テスト観点の洗い出し、設計レビューの支援、障害の一次分析、ドキュメント生成、定型的な調査など、AIに渡せる仕事は大量にある。

業務を分解する人に必要なもの

どこをAIに渡せるかを見つけるには、業務を分解する人が要る。その人には、現場経験、技術知識、業務理解、AIの能力についての理解、それに業務そのものを疑う姿勢が必要になる。生成AIに詳しい人を一人置けば済むことではない。

Copilotを配る。ChatGPTやClaudeを使えるようにする。AI研修を行う。ここまでは多くの会社がやるだろう。差が開くのはその先で、仕事の構造を組み替えられるかどうかだ。組み替えるには、自動化度、人間の介入点、監督能力、資源配分、自動化を止めている理由を、自分たちの業務に合わせて測る必要がある。

7. 借り物の「物差し」

同じ記事を読んだ二つの会社

ここまでで、この指標が一般企業にも応用できることは書いた。

ただ、応用して意味があるかどうかは、また別の話になる。

どういうことか。同じAnthropicの記事を読んだ二つの会社を考えてみる。

A社は「Automation Levelという指標があるらしい。うちでも測ってみよう」と考える。

B社は、なぜAnthropicは今、自動化度を測る必要があると判断したのか、同じ構造変化を自社で捉えるには何を測ればいいのか、半年後にAIの能力が上がったとき消える工程はどれか、と考える。

A社の取り組みも無駄にはならない。ただ、A社の手元に残るのはAnthropicの問いに合わせて作られた数字で、自社の状況から出てきた問いは残らないだろう。

他の組織がある問いに迫られて作った指標を、その問いを持たないまま自分の組織に導入する。ここでは、この状態を仮に「借り物の物差し」と呼んでみたい。こういう物差しは導入できるし、数字も出てくる。けれど、その数字で何を判断するのかが決まっていないので、数字は報告書に載るだけで終わる。

指標は「問い」のあとから出てくるもの

Anthropicの三つの指標は、AIが自分自身を作り始めたとき、人間は状況を把握できるのかという問いから出てきた。問いが先にあり、指標はその結果である。

外部の事例を参考にすること自体は悪くない。困るのは、外部の事例が出てくるまで問いを持てないことだ。先進事例を知ってから動く会社がいつも一歩遅いのは、事例が出るのを待っている間、自分たちで問いを立てていないからだと思う。

Anthropicは、組織がボトルネックを見つけて解消する速さが、どの組織にとっても最も重要な能力になるかもしれないとも書いている[14]。ボトルネックを見つけるには、何を測るかを自分で決められなければならない。

おわりに

Anthropicの発表の価値は、個々の数字より、AIの進歩をモデル性能だけでは測れなくなったことを、測定方法の形で示した点にあると思う。

自社で何を測るべきかは、Anthropicの記事には書かれていない。書かれているのは、Anthropicが何に迫られて何を測ったかだ。

それを自分たちの問いに翻訳できるかどうかに、組織の差が出る。
「なるほど、これをうちでもやろう」と思ったときには、問いそのものはもう他社から与えられた借り物なのだ。


☕️よかったらコーヒー一杯。 https://buymeacoffee.com/mink_obs

著:霧星礼知(min.k) / リサーチ・構造支援:Claude Opus 5、ChatGPT / AI-assisted / Structure observation


For international readers

Anthropic has published three measurements for tracking the pace of AI development inside frontier labs: how much AI R&D is led by AI itself, how well AI agents are overseen, and how compute is allocated. As of August 2026, Claude "leads" 26% of Anthropic's AI R&D work, up from under 1% in February. This essay argues that these metrics can be adapted by ordinary companies, including Japanese system integrators, by breaking work into tasks, rating their automation level, recording why automation stops, measuring review capacity, and tracking how person-hours and budgets are allocated. But copying the metrics is not the point. They exist because Anthropic faced a specific question: can humans still understand and intervene when AI becomes the main actor in its own development? The author calls the habit of importing another organization's metrics without its underlying question "borrowed yardsticks." What separates organizations is whether they can translate someone else's measurements into questions of their own.

Keywords

Anthropic, AI R&D automation, Automation Level, agent oversight, compute allocation, organizational metrics, borrowed yardsticks, system integrators, Amdahl's law, organizational capability

Anthropic、AI研究開発の自動化、Automation Level、AIエージェントの監督、計算資源の配分、指標設計、借り物の物差し、SIer、業務分解、アムダールの法則、組織能力


  1. Anthropic Institute, "Measurements for understanding the pace of AI development inside frontier labs," 2026. https://www.anthropic.com/institute/measuring-pace-of-ai-development 三つの測定(AI-led AI R&D / Oversight of AI agents / Compute allocation)を提示し、Anthropic社内のスナップショットを公開している。 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  2. Epoch AI, "Toward an O*NET for AI R&D," 2026. https://epochai.substack.com/p/toward-an-onet-for-ai-r-and-d AL0(AI関与なし)からAL5(人間を介さない完全自律)までの6段階。Anthropicはこの尺度をR&D Automation Indexに採用している。 ↩︎

  3. 前掲[1:1]、脚注1。夜間データパイプラインの障害対応を例に、AL3・AL4・AL5の違いを説明している。AL4でもデプロイの判断は人間に残る。 ↩︎

  4. 前掲[1:2]。2026年8月時点でAL4(AI leads)が26%、AL3(AI collaborates)以上が90%超、AL5に該当する測定対象業務はなし。掲載グラフでは2026年2月時点のAL4比率は1%未満。 ↩︎

  5. 前掲[1:3]。2026年8月時点、主要社内プラットフォームで常時約3万のエージェントが稼働。オンライン監視のcoverageは100%、10億件超の判断のうちブロック率0.002%。オフライン監視は週約10万件をフラグし、人間レビューに上がるのは週約50件。 ↩︎

  6. 前掲[1:4]。2026年7月13〜20日のスナップショットで、AI R&D向けcomputeの約6%、AI主導AI R&D向けcomputeの約12%が安全関連。能力向上と安全の双方に寄与する作業はAI R&D側に数えた保守的な推計であり、compute比率は安全への注力度の不完全な代理指標だと明記している。 ↩︎ ↩︎

  7. Anthropic Institute, "When AI builds itself," 2026. https://www.anthropic.com/institute/recursive-self-improvement 2026年5月時点でマージされたコードの80%超がClaudeによるもの。2026年第2四半期にエンジニア一人が1日にマージしたコード行数は2024年比約8倍で、行数は実際の生産性向上を過大に示す可能性が高いと注記されている。 ↩︎ ↩︎ ↩︎

  8. 前掲[1:5]、"Reasons to track these measurements"。能力評価が「モデルが何をできるか」を測るのに対し、本指標は「モデルがどう作られているか」を測る補完的なものと位置づけている。 ↩︎

  9. 前掲[1:6]。公開の目的を、一般の人々・第三者・政府がフロンティアAI開発の速度を把握できるようにするためとし、複数組織の独立した第三者評価者を社内に受け入れて主要指標を監視させる計画に触れている。 ↩︎

  10. 前掲[1:7]、Appendix。2026年7月の各週に対象部署の社員20%を抽出し、約15,000件のタスクを収集。542ノード(うち末端378)の木構造に整理して固定し、各ノードの重みは投入された人の時間で算出している。 ↩︎

  11. 前掲[1:8]、Appendix。判定モデルと担当者の完全一致率は59%、担当者同士は35%。1段階以内の一致は97%。AL3とAL4の境界などには判断の余地が残るとしている。 ↩︎

  12. 前掲[7:1]。コード生成が増えた結果、人間のコードレビューが新たなボトルネックになったことを、アムダールの法則の組織版として説明している。 ↩︎

  13. 前掲[1:9]。安全研究と能力研究の区別は難しく、開発者は線を広めに引きたくなるため、安全関連であることを示す責任は開発者側に置くべきだとし、定義を事前に揃えることを提案している。 ↩︎

  14. 前掲[7:2]。組織がボトルネックを見つけて解消する速さは向上しうる能力であり、あらゆる組織にとって最も重要な能力になるかもしれないと述べている。 ↩︎