## 概要
2026-06-03、YouTube動画100本を単一URL連投で一括学習。10並列サブエージェントで字幕取得→スコアリング。**yt-dlpのPO Token障害は完全復活**(android_vr警告は出るが日本語字幕は正常取得、字幕取得成功率98%=100本中失敗2本のみ)。全動画が2026-06-01〜06-03投稿で鮮度満点。スコア60点以上=27本、うち中華系API(MiniMax M3関連4本)はポリシー上参考のみ、既知重複(MMPO/Goal Buddy索引/Opus4.8一部)あり。

## 最重要の新規収穫

### 1. Codex Sites(RF4ICxAAPMQ 95点・Sura×Asura)
2026/6/2 OpenAIライブ「Intelligence at Work」でCodexに追加。**成果物をローカルファイルでなくホスト済みWebアプリ(生きたURL)として返す新機能**。シナリオプランナー/プロジェクトボード/レビューギャラリーを自然言語から生成。環境変数・シークレット管理でAPIキーを使う実アプリも稼働。Annotations=ドキュメントの特定部分のみにAI指示。Codex週500万人・うち2割が非エンジニアで増加3倍。ChatGPT Business/Enterprise限定(Plus/Pro/FreeはPreview)。OpenAI公式デモ動画=5UlRL_ImvQ0(83点)。

### 2. ハーネス論の決定打 — Cursor Composer 2.5(XOCVdPIhAHg 93点・Tech With Tim)
Composer 2.5(Kimi K2.5チェックポイント由来MoE)がOpus4.7/GPT-5.5とほぼ同等性能で**3〜4倍高速・約14倍安(タスク$0.50 vs Opus$7)**。だが本質はモデルでなく『ハーネス(コンテキスト管理/ツール/サブエージェント/ループ/索引)』。**同じOpus/GPT-5.5でもCursor上の方が良い結果**=「モデル=エンジン、ハーネス=車」。複数動画が同じハーネス論を補強(Gg4LfQb3s3U 80点=モデル/スキャフォールド/ハーネスの3部品論、Hugging Face曰くICLR2026でも定義割れのバズワード)。

### 3. Zed エディタ(Xn29p9mXUOE 92点・Shin Coding Tutorial)
Rust製軽量エディタZedをClaude Code/Codexの実行環境に。専用AIパネルで日本語が読みやすくCLIより視認性高。**カーソル比でメモリ消費半分〜1/3・起動爆速**。settings.jsonでキーマップ/パネル位置設定、MCP/SkillsもGUI追加可。ただしAIパネルは/mcp等一部スラッシュコマンドとリモートコントロール未対応でCLI併用要。

### 4. Odysseus(-CoCF9koVfc 90点・AICodeKing)
**PewDiePie製セルフホスト型AIワークスペース**。Ollama経由でGemma 26B等ローカルモデル、OpenCodeベースagent(Web検索+シェルツール)、HWスキャンしモデル推奨するCookbook、モデル盲検比較、Memory/Notes/Calendar/Mail内蔵。OpenRouter/NVIDIA NIM接続可。ローカルファースト・非マネタイズ。Hermes/OpenClaw代替候補。

### 5. 型エラーAblation論文(77SGs8XRUcQ 85点・さとるチャンネル)
arXiv「Type-Error Ablation and AI Coding Agents」(2606.01522)。**①エラーメッセージは省略せず全文(スタックトレース・unificationトレース込み)で渡せ**=削除実験で情報を消すとAI修正成功率が低下。②テスト失敗より型エラーの方がAIは直しやすい(型エラーは構造の矛盾を住所付きで指す)。③変数名を完全に隠してもAIはコードの「形」で読める。④再現コマンド(npm test等)も一緒に渡すと自己検証で自動修正ループを回せる。言語選定に「AIエージェント親和性」という新軸。

### 6. Goal Buddy 詳細ハンズオン(q7Am0pV6FjQ 88点・AI LABS)
※索引は既知(MEMORY.md 2026-06-02)だが実装詳細が新規。Claude Code/Codex両対応プラグイン。native /goalの弱点(チャット文脈のみが真実源→compaction後劣化・タスク分割なし・完了定義曖昧)を克服。①状態をローカルstate.yamlに強制書き出し。②**Oracle=観測可能で検証可能な完了条件**(テストスイート/ブラウザ走破/ベンチ/成果物)。③3エージェント=read-only Scout(低effort)・edit権限Worker(1タスクずつ)・high-reasoning Judge(read-only)+PMスレッド。④Slices=allowed files/検証手順/停止条件付き安全分割。⑤ライブダッシュボード。goal prepで曖昧さを質問解消。現状は逐次実行で並列化が課題。

### 7. Agentic Architecture(PZs4srSaHEg 82点 / VWi2K2EJ_zQ 85点・AI共創イノベーション)
**Agentic Loop=観測→計画/推論→実行→評価/適応の4ステップ**。メモリ階層4層(ワーキング/短期セッション/エピソード記憶/セマンティック記憶)。書き込み・通信ツールにはガードレール(Human-in-the-loop承認)必須、フローエンジニアリングで無限ループ・ハルシネーション抑制。実装デモ=Chrome拡張サイドエージェント(YouTube要約→X投稿を自律実行)、計画立案をモデル丸投げにせずアプリ側でプロンプト/コード注入してエンハンス。

### 8. Pi Agent Observability(o4KZH_KSqYQ 90点・IndyDevDan)
Pi coding agent+自作ダッシュボードでMarkdown/HTML/Enhanced HTMLの3種specをGemini3.5 Flash×3体で実測比較。命題=**「performance/speed/costのトレードオフ三角形を測れ=測らなければ改善できない(engineering vs gambling with tokens)」**。全イベント・ターン・ツール呼び出しを中央サーバにストリーム。意外にもMarkdown agentがHTML agentよりトークン消費多く29ターン使用。GitHub公開(pi-agent-observability)。

## Opus 4.8 ハンズオン群(複数チャンネルで一致)
- **/effort制御**(Low/Medium/High/XHigh/Max+ultracode)でトークン消費・待機時間50%削減。skillのYAMLフロントマターに仕込める(zZ3ISOUNT5w 85点・1Qe75J_LAqo 75点・7hNin5HWSlM 82点)
- **正直さ向上**:不明点を「分からない」と明言・ミス見逃しが従来の1/4
- **Fast Mode** 従来6倍→3倍に値下げ・2.5倍速(時間あたりコスパ約7.5倍向上)
- ゲーム/動画編集ソフトをブラウザだけで自作・/goalで一気通貫
- ドット絵生成は苦手(GPT Image 2/ChatGPTが優秀)→スプライト画像は外部画像モデルで用意し短いプロンプトで一発生成(N8_GLZC7pOs 85点)

## セキュリティ知見
- **security-guidance プラグイン**(PxT8nZGUnrs 85点・7hNin5HWSlM):AI生成コードの45%(Java72%)が脆弱・スロップスクワッティング(幻覚パッケージ攻撃、商用5.2%/OSS21.7%)。設計=「書くAIと見るAIを完全分離」しフレッシュコンテキストで独立レビュー。3層防御=ファイル編集後(正規表現高速)/ターン終了時/コミット時。落とし穴4つ=サイレント無効化/ReDoSフリーズ/コスト暴騰/poisoned well症候群
- **Meta AI bot乗っ取り**(GhXR2x5yNz4 74点):サポートbotの本人確認不備をVPN+偽メールで突きInstagram乗っ取り=エージェントの認証回避リスク事例
- **Starlette BadHost脆弱性**(同):週3.25億DLのStarletteでHostヘッダ検証不備→認証なしMCPサーバ/vLLM基盤が露出。ai-dev-server教訓と整合
- **GitHubトークン62%削減3手法**(bAWdofnKzMQ 62点):未使用MCPツール定義(40個)除去・PR差分をMCPからgh CLIへ置換・日次監査ループ

## モデル動向
- **3モデル比較**(3SZ0oCDSVbM 88点・WorldofAI):GPT-5.5=本格コーディング総合最強/Opus4.8=長期コーディング・推論・信頼性・エージェントWF/Gemini3.5 Flash=やや劣るが安価でほぼ追従
- **GPT-5.5計画能力**(ZrEc46wUIPU 74点・Lovable証言):プランニング中の意図理解31%向上・コンテキスト忘却22%減
- **GPT 5.6 リーク**(xqw4Aj-WRqg 78点):6/9-11頃リリース予想・Mythosと同ティアでより安価・トークン効率重視。Mythos本命は6月。Gemini 3.5 Proは6月予定だが初期テスター評価低
- **Anthropic IPO**(qW-h9bw8ZxQ 83点・RyMIFzop6cw・複数):SECにS-1機密提出でOpenAIに先行・評価額150兆円。Claudeレートリミットリセット+過剰サブエージェント生成のトークン浪費バグ修正
- **Codex AWS GA・Python SDK**(RyMIFzop6cw 72点):GPT-5.5/CodexがAWSで一般提供開始、Codex Python SDKリリース
- **NVIDIA Vera CPU**(Phv17g4fNx4 70点):世界初「AIエージェント専用CPU」。公称x86比1.8倍は最有利値、独立ベンチ実測は1.5倍。エージェントのボトルネックがGPUでなくCPU側の指示出し負荷である点

## ツール/ハンズオン
- **Hermes Desktop**(x3THNK_qFSg 85点):Hermes AgentのGUI(github fathah/hermes-desktop)。Grok/Gemini/Codex等14+プロバイダ、92スキル、Kanbanでタスク割当。認証画面に不具合あり`hermes setup model`併用が無難
- **Copilot CLI Skills/MCP**(XEJDFeOYQXY 93点・LXlIKGcgNlE 83点・Net Ninja):.github/skillsにSKILL.md相当配置、ask_userツールでHITL。/mcpでサーバー一覧、プリインGitHubサーバー
- **Qoder**(u62lqyuYQ-0 74点):Alibaba系。Claude Code酷似UX(ESC2回rewind)。月$20。Qwen3.7-Max/GLM/Kimi/DeepSeek対応だが米国系非対応=中国系で機密送信NG
- **役割分担テンプレ**(T3Snk1EVp_Q 78点):原案(人)→企画/設計(Sonnet4.6)→レビュー(Opus4.8)→チューニング(人)、実装からCodex(GPT-5.5)
- **Microsoft Scout**(730FCDZz77A 78点):OpenClaw的な常時稼働エージェント(米国先行)。Hermes Agent Desktop、MAI Code 1 Flash等も

## 対象外(記録せず):73本
PIVOT系ビジネス/組織/投資対談(多数)、ガジェット開封、AliExpressセール配信、量子コンピューター解説、動画生成AI(DomoAI/HitPaw/Vidu/Google Flow)プロモ、サムネ講座、ターミナル初心者Tips、AWS資格講座、地政学・中国経済、Tails OS、AI創薬投資、NVIDIA Cosmos3(物理AI/World Model=LLMコーディング外)等。MiniMax M3関連4本(5Atmc4wW1k0/V0c62734ix8/p6Npi-HBoRU/-0G6L8bmNUg)は中華系APIのため不使用ポリシー(feedback-no-chinese-apis)対象=性能トレンドの参考のみ。

## アクションアイテム
1. Zed エディタをshadow開発環境で試用(メモリ/起動速度をcursor実測比較)
2. 型エラーAblation知見(エラー全文+再現コマンド添付)をthinking-model-best-practicesの検証ループに追記
3. GitHubトークン62%削減3手法をClaude/Codex運用に適用(未使用MCP定義除去・PR差分gh CLI化・日次監査)
4. Goal Buddyのstate.yaml/Oracle/3エージェント構成をgoal-judgeスキルと統合検討
5. Agentic Loop4ステップ・メモリ4層・ガードレール(承認境界)をsymphony-loop設計に反映
6. security-guidance 3層防御の落とし穴(ReDoS/コスト暴騰)をsecurity-check-hook運用に反映確認
7. Cursor Composer 2.5をコスパ枠としてmulti-model-routing.mdに評価追記