## 情報源
- URL: https://www.youtube.com/watch?v=yOq2qIZKcO0
- タイトル: 【世界で話題】ARC-AGI3で95.5%?! 自己改善『Prime Agent』を徹底解説!ツールは Python 1 つだけ等仕組みが面白い
- チャンネル: まさおAIじっくり解説ch
- 投稿日: 2026-08-10 / 約15分 / 再生3,015 / いいね58
- スコア: 90/100(関連性30・鮮度25・信頼性15・深度20。**ベンチマーク値を自分で割り引いて話す**姿勢があり、宣伝動画になっていない)

## 主要な発見

### 1. ツール定義を1個に畳む(本命)
Prime Agent がエージェントに与えるツールは **Python 実行環境を動かすツール1つだけ**。ファイル編集・サブエージェント起動・Web検索は、すべてその Python 環境の中の**関数呼び出し**として実行する。

得られるもの:
- **ツール定義を何十個もシステムプロンプトに載せなくて済む**(コンテキスト節約)
- **道具を増やす時は関数を1本足すだけ** — ツール定義の変更もコード変更も不要
- 実行環境が使い捨てにならないので、途中で読んだデータ・中間結果が**変数として環境側に残り、エージェントのコンテキストには膨らまない**

サブエージェントからの戻りは**要点だけ print して返す**設計で、途中経過は環境に置いたまま親に流さない。

### 2. 自己改善の実態はシステムプロンプトの差し替え
「自己改善型言語モデル」という派手な名前だが中身は素朴:
1. 直近の作業ログをモデルに渡す
2. 設定の更新案を JSON で返させる
3. `harness_state.json` 的なファイルを更新
4. **その内容をシステムプロンプトに入れて次のターンを開始**

投稿者の評価は「仕組み自体は斬新ではない。頭には置いておきたいが自分は使わない」。**ソースコードが公開されている**ので、自分のハーネスに足りないものを探す読み物としての価値を推している。

### 3. ベンチマークの扱い(重要な注記)
ARC-AGI3 の高スコアは「**スコア稼ぎの部分だけ観測された**」という指摘があり、投稿者も「そうなんだ、ぐらいで読んでおくといい」と距離を取っている。比較として挙がった数字(Claude Opus を ARC-AGI ハーネスで動かすと約30%、GPT-5.6 で13.3%)も、**ハーネスが違えば数字が動く**という文脈で出されている。→ [[instinct-findings-are-counted-in-defects-not-reports]] と同型で、**単一スコアの大きさは能力の証明にならない**。

### 4. 構造
- ループ側は TypeScript、実行環境は Python
- 親エージェント → RLM で**自分と同じ構造のサブエージェントを別セッションとして生成**(ネスト可能)
- 親は `list_subagents` 相当で進捗を確認する
- モデルは差し替え自由(OpenCode 5 等のサブスク / APIキー)
- Claude Code のサブエージェントより**決定論的・機械的な呼び出しに寄せている**のが設計差

### 5. 未解決として名指しされた課題
**スキルが増えていった時に本当に正しく呼び出されるのか** — 自己改善でスキルが自動増殖する設計は、そのままスキル選択の劣化に直結する。投稿者自身が独自に考えている論点として挙げている。

## 既存知見との接続
- [[instinct-context-cost-measured-in-bytes-not-files]] — ツール定義の削減はまさに「常時注入コストをバイトで減らす」施策。
- 「スキルが増えると呼ばれなくなる」は当環境の CLAUDE.md 100行制限・命令ドリフト防止と同じ懸念。**自動でスキルを増やす仕組みを入れるなら、増やす側と同時に淘汰する側が要る**。

## アクションアイテム
- **段0(記録のみ)**: Prime Agent 自体は導入しない。当環境は Claude Code のハーネスに資産が積み上がっており乗り換え理由がない。
- **段3候補**: 「ツールを増やす前に、既存ツールの中の関数として足せないか考える」— 常時注入されるツール定義を膨らませない原則。