**AIエージェント ハーネス設計ガイド(2026年最新トレンド対応)**

### 1. ハーネスとは何か?なぜ今重要か

**Agent = Model + Harness**

- **Model**: LLMが「考える」部分(推論・計画立案)
- **Harness(ハーネス)**: モデルを包む「制御・実行・保証システム」。馬具(手綱・鞍)の意味から、人間が方向性をsteerし、エージェントの力を安全かつ効率的に引き出す仕組み全体を指す。[[1]](https://x.com/taimuhanashiro/status/2023008135464788127)

2026年現在、最も重要なのは**Harness Engineering(ハーネスエンジニアリング)**です。同じモデル・同じベンチマークでも、ハーネス(ルール・スキルファイル・ツール構成・フィードバックループ)を変えるだけで性能が42%→78%に跳ね上がった事例が複数報告されています。[[2]](https://x.com/i/status/2037332209003282747)

哲学はシンプルです:
> 「エージェントが1回間違えたら、手動で直すのではなく、**二度と同じ間違いを犯さないようシステム(ハーネス)をエンジニアリングする**。」

これはPrompt Engineering(2023)→ Context Engineering(2025)の次のステージです。モデルは商品化されつつあり、差別化要因は「その組織・ドメインに最適化されたハーネス」になります。OpenAIのCodexチームが人間が1行もコードを書かずに100万行超の社内プロダクトを構築した事例も、この考え方が基盤です。[[1]](https://x.com/taimuhanashiro/status/2023008135464788127)

### 2. 推奨アーキテクチャ(Layered Harness Design)

ハーネスを**変更容易性(Maintainability)を最優先**に設計します。ハーネスは肥大化しやすいため、Gota氏が指摘するように「優先順位付け」と「頭の使い方」が重要です。[[3]](https://x.com/i/status/2046794926604931447)

#### 推奨レイヤー構造

```
Human / Product Owner
↓ (Goal設定・制約・最終承認)
[Harness Core]
├── Soul Layer(魂):硬いルール・行動憲法(CLAUDE.md / AGENTS.md)
├── Skills Layer(技能):オンデマンドMarkdownモジュール(漸進的知識開示)
├── Capability Layer(能力):Tool + MCPサーバー(最大2-3個厳守)
├── Runtime Engine(実行エンジン):Loop + State Machine + Hooks
├── Memory & Persistence Layer:ステップ永続化・圧縮・チェックポイント
├── Sub-Agent Manager:コンテキストファイアウォール(長タスク分離)
└── Safety & Verification Layer:Pre/Post Hook、人間介入、LLM-as-Judge

[Observability + Evaluation Harness] ← 並行設計必須
├── Full Tracing(Thought → Action → Observation全て記録)
├── Metrics(成功率・経済性・安全性・編集容易性)
├── Regression Test Suite + Self-Harness Improvement Loop
└── Dashboard(trajectory可視化)
```

### 3. 各レイヤーの詳細設計

**1. Soul Layer(最も重要)**
- 60行以内に**硬いルールのみ**記述(AI生成禁止)。
- 内容例:品質基準、禁止行動、思考フォーマット、エスカレーション条件、ドメイン固有の憲法。
- ETH Zurichの調査でも、人間が書いた短い硬ルールが最も効果的だった。

**2. Skills Layer(2026年の勝負所)**
- 全てをプロンプトに詰め込まず、**漸進的知識開示**(必要なスキルだけロード)。
- Markdownファイル群としてバージョン管理(skillportなどのツール推奨)。
- タスク種別ごとに分割し、RAG的または明示的importで呼び出す。

**3. Runtime Engine(心臓部)**
- 基本ループ:**Think → Plan → Act(Tool or Sub-agent) → Observe → Verify → Loop or Escalate**
- **Hooksが最もインパクト大**:
- Pre-Action Hook(リスク分類 → 自動/人間承認)
- Post-Completion Checklist
- Failure Handler(失敗ログを自動解析し、新ルール提案)
- ステートはUUID + Redis/Postgresで永続化。任意の時点からresume可能。
- 長期実行時は自動compaction(記憶圧縮)を実施。

**4. Capability & Tool Layer**
- **ツール数は絶対に3個以内に抑える**(tool thrash防止)。
- MCP(Model Control Protocol)風の標準化されたツールインターフェースを採用。
- 各ツールに明確な権限スコープとサンドボックスを設定。

**5. Safety & Human-in-the-Loop**
- 高リスク行動(金銭操作・コード実行・外部API呼出)は必ずPre-approval。
- 出力ガードレール(PII検知・毒性チェック・事実検証)。
- Sub-agentは「コンテキストファイアウォール」として活用(主エージェントのコンテキストを汚染しない)。

### 4. Evaluation Harness(評価ハーネス)の並行設計

エージェント本体と**分離して設計**すべきです。

- **Evals** = 測定基準(Task Completion, Cost Efficiency, Safety Score, Editability)
- **Harness** = それらを自動実行・比較・回帰テストするインフラ
- ワークフロー:Test Dataset → Run with current Harness → LLM-as-Judge + Human Preference → Report + Regression Detection
- 生産環境では常時ONではなく、**プロンプト/スキル/ハーネス変更時**に実行。
- Langfuse / LangSmithをベースに、カスタム評価ロジックを追加することを推奨。

### 5. 実装ベストプラクティス & 落とし穴回避

**推奨習慣**
- **Config-First / Schema-First**:ハーネス定義をYAML + JSON Schemaで管理(コードより設定優先)。
- **Weekly Failure Review**:毎週失敗を振り返り、1つずつルールをharnessに追加。
- **Self-Harnessing**:エージェント自身に失敗を分析させ、harness改善を提案させる閉ループ(最新研究でも有効)。
- 全てを1つの巨大プロンプトにしない。SkillsとHooksで分離。

**避けるべきアンチパターン**
- ツールの多重化(tool thrash)
- コンテキストの肥大化(長文脈での性能低下)
- 変更しにくい巨大ハーネス(肥大化したら即リファクタ)
- 評価ハーネスを後回し(これをやると「なんとなく動く」止まりになる)

### 6. 技術スタック例(すぐに始められる構成)

- **コア**:LangGraph + Custom Harness または Pydantic AI Harness、AWS Bedrock AgentCore
- **スキル管理**:MarkdownベースのSkills loader(skillportなど)
- **観測性**:Langfuse / LangSmith / OpenTelemetry + Grafana
- **永続化**:Postgres(状態・履歴) + Vector DB(スキル検索) + Redis(実行中状態)
- **UI**:Streamlit / TUI(grok-build風) / Web Dashboard

### 7. 参考資料(必読)

- Qiita「ハーネスエンジニアリング入門 — Agent = Model + Harness で読み解くAIエージェント運用」[[4]](https://x.com/tech_wiki/status/2075833373541683208)
- @gota_bara SpeakerDeck「μでハーネスの設計〜ハーネスの変更容易性を高めるための優先順位〜」[[5]](https://x.com/gota_bara/status/2046794926604931447)
- Chen Cheng氏のHarness Engineering解説(5つのレバー:System Prompt, Skills, MCP, Sub-agents, Hooks)[[6]](https://x.com/chenchengpro/status/2037332209003282747)
- GitHub: `walkinglabs/awesome-harness-engineering`
- Philipp Schmidブログ「2026 will be the year of Agent Harnesses」

この設計は**ソフトウェア開発エージェント、業務自動化、研究エージェント**など幅広く適用可能です。具体的なドメイン(例:Findyのようなエンジニアリング組織での活用、コーディングエージェント、画像編集エージェントなど)を指定いただければ、さらに詳細な実装例やYAMLスキーマ、サンプルコードを提示できます。

必要であれば、Mermaid図でのアーキテクチャ図や、具体的なSkillsファイル・Hookの実装例も提供します。どのようなユースケースで使いたいですか?