**AIエージェント ハーネス設計(2026年最新アプローチ)**
2026年現在、AIエージェントの性能は「モデル weights」よりも**Harness(実行ハーネス)** が圧倒的に大きな影響を与えることが複数の研究で確認されています。同じモデル・同じタスクでも、ハーネスを変えるだけで成功率やコストが5〜30倍変わるケースが報告されており、SWE-benchではハーネス最適化だけで**6.7% → 68.3%**という劇的な改善例もあります。[[1]](https://x.com/beamnxw/status/2082746025958150333)
モデルを大きくする前に、ハーネスを systematically に設計することが最も高いROIを生みます。
### 1. 推奨アーキテクチャ:ETCLOVG 7層モデル
現在最も注目されているのは **ETCLOVG**(7層アーキテクチャ)です。これは単なるscaffoldingではなく、**非決定的なLLMをdeterministicで信頼可能なシステムに変換する制御層**として設計されています。
| 層 | 名称 | 主な役割 | 具体的な実装例 |
|---|------|---------|-------------|
| **E** | Execution Sandbox | 安全な実行環境の提供 | Docker/Pyodide/ブラウザ sandbox、権限隔離、rollback機能 |
| **T** | Tool Protocols | ツール呼び出しの契約定義 | 厳格なJSON Schema + Pydantic v2、versioned tool spec、error recovery protocol |
| **C** | Context State Management | 状態の永続化と選択的ロード | Working Memory / Episodic Memory / Semantic Knowledgeを分離。圧縮・要約・forgetting戦略 |
| **L** | Lifecycle Graphs | 実行ライフサイクルと制御フロー | 状態機械(State Machine) or LangGraphのような有向グラフ。Planning → Acting → Verifying → Adaptingの明確な遷移 |
| **O** | Observability | 完全な可観測性 | OpenTelemetry + Trace Store、全trajectoryを構造化保存(LangSmith風)。Decision Provenance記録 |
| **V** | Verifiers / Evaluators | 検証層 | Rule-based + LLM-as-Judge + Code Execution Verification + Human-in-the-loop。複数メトリクス(Success, Efficiency, Safety, Cost) |
| **G** | Governance | ポリシー・安全・監査 | Policy Engine、Approval Gates、Decision Provenance for Audit、Compliance Checker |
この7層を明確に分離することで、ハーネス自体を**バージョン管理・移植・自動最適化**しやすくなります。
### 2. 設計の核心原則(Best Practices)
- **Deterministic by Design**:LLMの非決定性をハーネス側で吸収(retry戦略、verification loop、bounded computation)。
- **Observability First**:何が起きても「なぜその決定をしたか」を後から再現可能にする。これがGovernanceの基盤。
- **Code as Harness**:重要な制御ロジックを自然言語プロンプトではなく、**実行可能なコード**(Pydanticモデル、グラフ定義、検証関数)として表現。
- **Bounded Efficiency Template**:無限思考を防ぐために「scope / acceptance criteria / stop condition」を明示的に注入。
- **Harness Optimization as Meta-Problem**:Meta-Harness的なアプローチ(過去の全実行履歴を見てハーネス自体をAgentが改善)を検討。
- **Multi-metric Evaluation**:単なるtask successだけでなく、以下の4つを常に測定:
1. Skill Selection Accuracy
2. Tool Invocation Correctness
3. Interpretation & Execution Fidelity
4. Overall Efficiency (tokens, turns, cost)
### 3. 実装時の推奨技術スタック
**Minimal Viable Harness(おすすめ)**
- **Orchestration**: LangGraph(または自前State Machine + asyncio)
- **State Management**: Pydantic v2 + Redis/PostgreSQL(structured state)
- **Observability**: LangSmith or OpenTelemetry + ClickHouse/Elastic
- **Evaluation**: DeepEval + Custom LLM Judge + Rule engines
- **Sandbox**: E2B, Modal, or custom Docker + seccomp
**より本格的なProduction Harness**
- ETCLOVGを意識した専用フレームワーク(Turaなどのオープンソースも2026年に登場)
- Natural-Language Agent Harnesses(制御ロジックを構造化自然言語で記述し、runtimeで解釈実行)
### 4. 設計スケルトン例(Python)
```python
from pydantic import BaseModel
from typing import Literal
import asyncio
class AgentState(BaseModel):
task: str
context: dict
lifecycle_stage: Literal["planning", "acting", "verifying", "adapting", "complete", "failed"]
provenance: list[dict] # 決定履歴
cost: float = 0.0
class ETCLovgHarness:
def __init__(self):
self.sandbox = Sandbox()
self.tool_registry = ToolRegistry() # strict schema
self.state_manager = StateManager()
self.lifecycle = LifecycleGraph()
self.observer = Observer()
self.verifier = MultiVerifier()
self.governance = GovernanceEngine()
async def run(self, task: str, model: str):
state = AgentState(task=task, ...)
for step in self.lifecycle.get_flow():
self.observer.log_step(state)
# E/T層
action = await self.get_action(state, model)
observation = await self.sandbox.execute(action)
# C層更新
state = self.state_manager.update(state, observation)
# V層
if not await self.verifier.verify(state):
state = await self.lifecycle.handle_failure(state)
continue
# G層チェック
if not self.governance.is_compliant(state):
break
return self.verifier.final_score(state)
```
### まとめ:設計の優先順位
1. **Observability + Provenance**(これがないと全てが無意味)
2. **Verification / Evaluation**(信頼性の根幹)
3. **Lifecycle Graph**(制御フローの明確化)
4. **State & Context Management**
5. **Sandbox + Tool Protocols**
6. **Governance(後回しにしがちだが重要)**
モデルをアップグレードする前に、ハーネスを徹底的に磨く時代です。特定のドメイン(Coding Agent, Web Agent, Enterprise Agentなど)向けの詳細設計が必要であれば、用途を教えてください。より具体的なレイヤー設計やコード例をお渡しします。
X Learn [2026-08-08] AIエージェント ハーネス 設計