## 情報源(2本束ね・domain=ai)
- 3SZ0oCDSVbM GPT 5.5 vs Opus 4.8 vs Gemini 3.5 - Which Model Should You Use? (WorldofAI・スコア72)
- N8_GLZC7pOs Claude Opus4.8でプロ風ゲームを作る方法/Claude CodeとCodexの選び方 (ウェブ職TV・スコア74)

## 主要な発見
### モデル別の強み(WorldofAI独自ベンチ)
- **GPT-5.5**: 総合1位(77.4)。推論・複数ステップエージェントワークフロー・デバッグで最も信頼性高い。**Thinking effort=High が最もコスパ良い**(Extra Highにしても大差なし)
- **Opus 4.8**: フロントエンドUIのデザインセンス(視覚的階層・余白・色使い)で圧倒。ただしトークン消費が激しい
- **Gemini 3.5 Flash**: 速度とコスト効率に優れ、安価で高速なデザインイテレーションに最適
- **Minimax M3 等オープンウェイト**: マルチモーダル推論・コーディングでクローズドモデルとの差を縮めつつある
- **World of AI benchmark suite**: 偽スコアでなくユーザー自身のプロンプトで実タスク評価できるツールがローンチ

### 推奨マルチモデル運用(リレー形式)
- 本格アプリ構築・デバッグ → **Codex + GPT-5.5(High)**
- フロントエンド高度デザイン → **Claude Code + Opus 4.8**
- 安価開発・OSS実験 → **Hermes agent**
- フロント分割WF: ①Geminiで高速プロトタイプ ②Opus 4.8でUI洗練 ③GPT-5.5で複雑機能・動的アニメ実装

### ゲーム生成(N8_GLZC7pOs)
- Opus 4.8は当たり判定・敵攻撃など複雑ロジックを細かい指示なしで自律構築
- 2ステップ: GPT Image 2でスプライト画像生成 → Web版Claudeに画像渡し「マリオ風アクションゲーム作って」
- **プロンプトは「ざっくり」が良い**: 細かく指示するとAIの自律思考を邪魔する。目的(What)だけ伝える
- ツール使い分け: 予算少・PC苦手→Codex(画像生成までAPI不要) / 高度連携→Claude Code

## アクションアイテム
- multi-model-routing.md の標準ルーティング表を更新(GPT-5.5=推論/バックエンド・Opus4.8=デザイン/フロント・Gemini3.5=速度の3軸)
- 「GPT-5.5 thinking=Highがコスパ最良(Extra High無意味)」を thinking-model-best-practices.md に追記
- World of AI benchmark suite を vvv のモデル選定実測に試用検討