## 情報源
- URL: https://youtube.com/watch?v=C37zdDKWXww (Anthropic 研究・顧客事例紹介)
- スコア: 95/100
## 舞台
**ABC Legal**(米国・法律書類の裁判所提出/送達を代行)。**1100人**の全社員に Claude Enterprise を配布。
- **最初に作ったのは財務やマーケの15人で、全員ソフトを書いたことがない人たち。その15人が1週間で動くエージェントを完成させた**
- 問題は「作られたエージェントが作った人の個人PCの中で動いていた」こと → 何が作られ、いくらかかり、昨日ちゃんと動いたのかが誰にも見えない
- → **Claude Managed Agents で全部を個人PCからクラウドへ移し、共通の置き場・共通の請求・共通の監査ログにした**
- **7月時点で本番稼働エージェント50体以上**、日常利用が全部門で約310人。**肩代わりした分の人の作業コストは、本格的な最適化前の段階で最大およそ半分**
## 核心(CTOの言葉)
> **「エージェントは実際のところ、ただの構造化されたテキストだ」**
プロンプトと設定でできていて、テキストであるなら会社の全員が見て直せて改善できる。**リポジトリに置ける**。
**リポジトリに置いた効果**: エージェントを変える方法が **PR 1つだけ**になる。誰かが承認しない限り何一つ変わらない。**変更履歴もレビューも巻き戻しも監査ログも全部ただでついてくる**。「業務の判断そのものをレビューの土俵に載せた」。
- **CTO が最初の1週間でやったのはテンプレートを2種類作ることだけ** — 「何かが起きた瞬間に動く方」と「定期的に動く方」
- **エージェント1体=1つのフォルダ**。中身は **設定JSON / システムプロンプトMarkdown / デプロイ用スクリプト / 運用手順書** だけ
- 使う人の作業は3つ: リポジトリをコピー → テンプレートを複製 → **Claude Code に「こういうことをして欲しい」と話す**(ソフトは1行も書かない)
## 自己改善の3体1組(最重要)
1. **1体目**が実際の仕事をして記録を残す
2. **2体目「ハーベスター(収穫者)」**が1時間ごと/1日ごとに Slack を巡回し、**人の返信と絵文字を1つずつ拾ってラベルのついたデータに変える**
3. **3体目「チューナー」**が週に1回まとめて見て**プロンプトや設定の変更案を PR で提案する。自分では直さない。読んで取り込むのは人間**
**モデルの重みは一切触らない。変わるのはプロンプトと設定だけ。学習し直さずに賢くしていく。**
姉妹会社ではこれが**4体1組**。仕事の振り分けルール約145本を画面の設定ではなく**1本ずつファイル**にしてあり、4体目が**人が承認した設定だけを本番に反映**する。**絵文字1つがその週のうちに取り込まれたルール変更として反映される**。人の手が入るのは**レビューの1工程だけ**。
## 実運用の判断基準
- **「これはエージェントにする価値がない」と言えることの方が大事**。全エージェントが実行のたびに「何時間分/何分の価値を出したか」を自分で報告し、運用コストと比べる
- **最初は大体赤字**(新しいうちは大きいモデルで走るから)→ **評価を書いて安いモデルに移して無駄なトークンを削って黒字に反転させる**。実際7月に利用量が増えたまま支出が下がった
- **最初の1体を選ぶ条件3つ**: 毎週必ず発生して / 手順が決まっていて / **間違えても人が気づける**仕事。そして**最初は必ず人の承認を挟む**
- **原則「全てのエージェントは単独で動く前に信頼を勝ち取る」** — 判断が人と一致し続けたものだけが自分で動く権利を得る。権利を得た後もずっと測られ続ける
## 具体例
- 裁判所に出した書類が却下された瞬間に自動起動 → 案件を読み、その裁判所のルールと突き合わせて原因を診断して Slack へ(**約1分**。従来は担当者の1日を何時間も食っていた)
- 開発では**4つのコードベースの全 PR を AI がレビュー**(セキュリティの穴・混入した認証情報)→ **今ではエンジニアがそのレビューを待ってからマージする**
- 品質審査エージェントはコンプライアンス部門と**約98%意見が一致**
## Managed Agents
- **4概念**: エージェント / 環境 / セッション / イベント。標準でシェル実行・ファイル読み書き・検索・外部ツール接続。**6月から cron 式を渡すだけで定期実行**(分単位)
- **Vault(保管庫)**: **鍵はモデルに渡らない**。エージェントの手元にあるのは代わりの文字列で、**本物の鍵は許可したドメインに通信する瞬間だけ外側で差し込まれる**(Claude Code アプデ8選の「サンドボックス内でトークンを直接見せない」と同じ設計)
- **料金**: セッション稼働時間 **1時間あたり0.08ドル** + 通常のトークン料金。公式計算例は Opus 5 で1時間・入力5万・出力1.5万トークンで**合計0.705ドル**、キャッシュが効くと約0.5ドル。**返事を待って止まっている時間は課金されない**
## 但し書き(動画自身が明記)
Anthropic が自社顧客を紹介したもので数字は ABC Legal 本人の申告。**失敗例も暴走例も1つも書かれていない**。98%一致の裏の2%が何だったのかも分からない。**Managed Agents はまだβで、履歴をサーバー側に預ける設計なので「一切保持しない契約」や医療情報向け契約の対象からは外れている**。
**一番の壁は AI ではなかった** — 業務の人がリポジトリの操作と PR に慣れることだった。
## アクションアイテム
- 当環境は `~/.claude` が ai-base リポそのもので PR 経由の変更は既に成立している。**欠けているのは「ハーベスター/チューナー」層**(人のフィードバックを収穫して週1で PR 提案する)
- agentd の各ジョブに「今回何分の価値を出したか」の自己申告を持たせ、運用コストと突き合わせる
エージェント50体を「リポジトリで運用する」— ABC Legal 事例 2026-08-21