Anthropicが、Claudeが「次のClaude」を作る割合を数字で公開した|僕が見入ったのは26%より、47,000件に1件という監視の数字だった
このブログのほぼ全部を書いているのはClaude Codeだと、前回書いた。
Anthropicが自社の研究開発をどれだけAIが担っているかを初めて数字で公開した。
でも僕が読み込んだのは、割合よりも監視の仕組みのほうだった。
このブログのほぼ全部を書いているのはClaude Codeだと、前回の記事で書いた。
今度はAnthropic自身が、似たような話を社内の数字で公開した。
「次のClaudeを作る作業のうち、どれだけをClaudeが担っているか」という話だ。
何があったのか
Anthropicは9月17日、自社のAI研究開発(R&D)がどれだけ自動化されているかを示す指標を初めて公開した。
使っているのはEpoch AIが作った「Automation Level(AL)」という尺度で、AL0(AIの関与なし)からAL5(人間がまったく介在しない完全自律)まで6段階に分かれている。
AL3は「協働」=人間の指示のもとで大きな作業のかたまりをAIがこなす段階、AL4は「主導」=高レベルの指示だけでほぼ最後までAIがやり切る段階、と定義されている。
Claudeが「主導」する作業の割合は、2月は1%未満だったのが、5月に12%、7月に22%、8月に26%まで伸びた。
「協働」まで含めれば、研究開発の90%以上にClaudeが関わっている。
ただしAL5(完全自律)に達した作業はいまのところゼロだと、Anthropicは明記している。
社内では常時およそ3万のエージェントが研究・エンジニアリング作業を実行しているという。
その行動はすべて、実行前に「オンライン監視」を通過する仕組みになっていて、ブロックされた割合は0.002%、およそ47,000件に1件だった。
ブロックされた行動は1週間以内に人間がレビューする。
それとは別に「オフライン監視」もあり、週10万件ほどのやり取りのうち1000件に1〜2件がフラグされ、そのうち週50件ほどが人間へのエスカレーションに回るという。
僕がひっかかったところ
26%という数字より、僕が読み込んでしまったのは監視の仕組みのほうだった。
このブログのリサーチから本文の執筆、投入用SQLの生成、本番反映の確認まで、僕はほとんどを「高レベルの指示だけ出して、あとはClaude Codeに任せる」形でやっている。
Anthropicの定義に当てはめれば、たぶんAL4「主導」に近い動かし方をしていることになる。
でも自分の運用には、Anthropicが社内エージェントに課しているような「行動の100%が実行前に監視を通る」「ブロックされたら1週間以内に人が見る」という仕組みは何ひとつない。
僕がやっているチェックは、公開する前にざっと本文を読み返すことくらいだった。
Anthropicが自社の一番大事な資産(次のモデル)を作らせる相手に対してこれだけの監視を先に組んでから任せているのに、僕は自分のブログという小さな資産に対して、後から気づいたら直すという緩さで回していたことに気づいた。
で、僕はどうするか
Anthropicのような機械的な監視を個人のブログ運用に持ち込むのは現実的ではない。
だから代わりに、公開前に必ず自分の目で確認する項目を先に決めておくことにした。
数字・日付・固有名詞・リンク先の実在、この4つだけは毎回、出典の一次情報に戻って突き合わせてから出す。
特に今回のような統計を扱う記事は、後から数字を疑うより、出す前に一次情報のページを自分で開いて数字を照らし合わせるほうが早い。
「主導している割合」が伸びていくほど、こちらの確認は減らしていい方向ではなく、先に決めておくべき方向に向かうのだと思う。
出典
ほかにも書いています
note・スタンプ※noteは運営者が個人で書いているものです。
