[[1]](https://x.com/tetumemo/status/2037876018745385083)[[2]](https://x.com/taimuhanashiro/status/2023008135464788127)[[3]](https://x.com/takish/status/2089076198462865888)[[4]](https://x.com/beamnxw/status/2089397727578783923)**AIエージェント ハーネス設計(2026年最新プラクティス)**

### 1. ハーネスとは何か(コミュニティの共通認識)

2026年現在、「**ハーネスエンジニアリング**」はプロンプトエンジニアリングの次のレイヤーとして広く認識されています。

- **モデル** = 脳(CPU)
- **コンテキスト** = 記憶・知識・RAG
- **ハーネス** = 手綱(Harness) / OS / 制御系

ハーネスは「エージェントの力を正しく・安全に・再現可能に引き出すための全装備」です。単なるReActループ(try → check → retry)はすでに「 primitve(原始的)」と見なされており、**Graph Harness(明示的DAG + Scheduler)** への移行が強く推奨されています。[[4]](https://x.com/beamnxw/status/2089397727578783923)

重要な原則(特にO'Reilly記事などで繰り返し言及):
> 「最初に作るべきは賢いエージェントではなく、**ログ・評価・再現性が確保されたハーネス**である。」

これがないと、モデルやツールをいくら変えても「なぜ成功したか/失敗したか」が分からず、改善が不可能になります。[[3]](https://x.com/takish/status/2089076198462865888)

**ハーネス vs ガードレール**(明確に分けるべき)
- ハーネス:実行・観測・再現・評価(改善責任)
- ガードレール:権限・承認・停止(被害限定責任)

### 2. 推奨アーキテクチャ(3-Layer Harness)

現代的なハーネスは以下の3レイヤーで構成します。

**Layer 1: Execution Harness(実行制御層)**
- Graph/DAG Scheduler(LangGraphを強く推奨)
- 明示的なノード(Plan → Tool Selection → Execution → Verification → Report)
- 無限ループ防止(step budget, token budget, timeout, escalation policy)
- Event-sourced Kernel(全ての行動をイベントとして永続化)

**Layer 2: Safety & Sandbox Harness(保護層)**
- **Git Worktree Sandboxing**(コーディングエージェント最強)
- Docker / gVisor / Firecracker
- Granular Permission Model + Approval Gates(危険操作で自動停止+人間 or LLM Judge承認)
- High-risk action detector(`rm -rf`, ネットワークアクセス, ファイル書き換えなど)

**Layer 3: Observability & Evaluation Harness(観測・評価層)**
- 完全Trajectory記録(thought, action, observation, cost, latency, git diffなど構造化)
- Post-hoc Evaluation(実行後、何度でも異なる評価器を適用可能)
- LLM-as-Judge(rubricベースの構造化出力)
- Replay & Regression Test機能
- 比較ダッシュボード(A/Bテスト、ハーネスバージョン比較)

### 3. コアインターフェース設計

```python
from pydantic import BaseModel
from typing import Any, AsyncGenerator
from enum import Enum

class RiskLevel(Enum):
LOW = 1
MEDIUM = 2
HIGH = 3
CRITICAL = 4

class TaskSpec(BaseModel):
id: str
description: str
success_criteria: str # 評価用rubric(重要)
ground_truth: Any = None
category: str
risk_level: RiskLevel
metadata: dict = {}

class TrajectoryEvent(BaseModel):
turn: int
timestamp: float
type: str # thought, action, observation, approval, error
content: Any
token_usage: dict = {}
cost: float = 0.0
metadata: dict = {}

class RunResult(BaseModel):
task_id: str
trajectory: list[TrajectoryEvent]
final_outcome: Any
success: bool
score: float
evaluations: dict[str, dict] # 複数evaluatorの結果
total_cost: float
duration: float

class AgentHarness:
async def run(
self,
graph: Any, # LangGraphなど
task: TaskSpec,
config: HarnessConfig
) -> RunResult:
"""
1. Sandbox起動(Git worktreeなど)
2. Event-sourced Kernelで実行管理
3. 危険アクションでApproval Gate発火
4. 全イベントを永続化
5. 実行完了後、自動で複数Evaluator実行
"""
...
```

**推奨実行モデル**
- 純粋なReActループ → 非推奨(コンテキストが肥大化し、数学的に終了性が保証しにくい)
- **Graph Harness(DAG Scheduler)** → 現時点のベストプラクティス

### 4. 実装優先順位(Overengineeringを避ける)

1. **最優先(最初の2週間で完成させる)**:
- 完全なTrajectory Logger + Replay機能
- Event Store(SQLite + WALが現実的)
- シンプルRunner(Plan → Execute → Evaluate)

2. **次に作るもの**:
- Evaluation Harness(Rule-based + LLM Judge with rubric)
- Sandbox(Git Worktreeを最優先で実装)

3. **その後**:
- Graph Scheduler本格導入
- Approval Gates + 権限モデル
- ダッシュボード(実行比較、失敗パターン分析)

### 5. 技術スタック推奨(2026年)

- **フレームワーク**: LangGraph(最重要) + Pydantic v2
- **永続化**: SQLite (WAL mode) または PostgreSQL + Event Sourcing
- **Sandbox**: Git Worktree(コーディング最強) + Docker
- **評価**: Claude 4 / GPT-4.1などのStructured Output + 自作Judge
- **UI**: Tauri(承認フロー) + Streamlit/FastAPI(ダッシュボード)
- **Observability**: OpenTelemetry + 自前Trace Viewer(LangSmith風)

### 6. ドメイン別Tips

- **Coding Agent**: DeepCode(HKUDS)方式が参考になる。Git Worktree + Approval Gates + MCP(Model Context Protocol)が特に強い。[[5]](https://x.com/AlcidesTicllaCh/status/2089437038982426973)
- **Enterprise Agent**: 権限モデルとHuman Escalation Gateを徹底。
- **Research/Web Agent**: Graphで「Search → Read → Verify → Synthesize」を明示的ノード化。

---

この設計は、2026年8月現在のコミュニティ(特に日本)の議論と、先進事例(DeepCode、Graph Harness論文、OpenAI内部事例など)を総合した実践的なものです。

**さらに深掘りが必要な部分**:
- 具体的なGraphのノード設計
- Evaluation Rubricのテンプレート集
- Git Worktree Sandboxの実装例
- Event-sourced Kernelのコード
- ダッシュボードUI設計

どの部分を詳細に設計しますか?
または特定ドメイン(コーディング・法務・リサーチなど)に特化したハーネス設計が欲しい場合は教えてください。すぐに詳細版を作成します。