## 情報源
| ch | タイトル | 尺 | スコア | 信頼度 |
|----|---------|----|-------|--------|
| AI時短ラボ | 【速報】Meta Muse Code & Muse Spark 1.2登場 | 13:47 | 90 | 高(一次ソースのみ・但し書き明記) |
| ワンダー佐藤源彦サテライト | 「Muse Spark 1.2」「Muse Code」とは?ハーネスネイティブなAIの登場 | 9:10 | 65 | **低**(後述) |
- 一次ソース: https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2 / https://developer.meta.com/ai/products/muse-code/
- URL: youtube.com/watch?v=fmofwIl9HiI / 2o0AwZRJU2A
---
## 公式ブログで確認できた事実(WebFetch で直接照合済み)
- **Muse Code**: ターミナル専用のコーディングエージェント。macOS / Linux、コマンド1行で導入、**ベータ**
- **Async Background Agents**: 本体ループ+専門化されたバックグラウンドエージェント群。タスクごとに立てて消すのではなく**セッション中ずっと生き続ける**。同じ情報を集め直す無駄が減り、次にやることと報告のタイミングを自分で決める
- **ローカルイベントログ**: モデル呼び出し・ツール実行・承認・編集を**すべて追記**し、それを唯一の正しい記録として扱う。実行をそっくり再生でき、落ちても止まった位置から再開できる(restart-safe)
- **付属スキル3つ**: `/plan`(承認ゲート付きの計画に変える)・`/grill`(その計画を持ち堪えるまで叩く)・`/goal`(目標達成まで走り続ける)
- **co-training**: モデルとハーネスを最初から一体で学習。rejection sampled harness trajectories/recipe optimizations/toolset integration。さらに **1.1 に難しいコーディング環境と指示テンプレを作らせ、1.1 が候補回答を採点して 1.2 の学習データにする**自己改善ループ
- ベンチマークは Terminal-Bench 2.1 / DeepSWE 1.1 / Meta Internal Coding Bench。**本文に数値記載はなく図表のみ**
## ベンチマーク(AI時短ラボが図表7枚から読み取った値)
| ベンチ | 1位 | Muse Spark 1.2 |
|--------|-----|----------------|
| Terminal-Bench 2.1 | Opus 5 + Claude Code 86.7% | 2位 82.9%(3位 GPT-5.6+Codex 81.8%) |
| MCP Atlas | **Muse Spark 1.2 90.3%** | 1位(1.1 が 88.1%、Opus 5 は 85.8% で3位) |
| Meta 社内コーディングベンチ | Opus 5 79.4% | 70.6% |
| DeepSWE | Opus 5 65.0% | 3位 59.3%(GPT-5.6 64.8%) |
| GDTVal V2 | Opus 5 185点 | 2位 163点 |
| GPU カーネル最適化 KDA | Opus 5 74.0% | 68.7% |
| GPU カーネル最適化 MLA | Opus 5 75.4% | 61.1% |
- **7枚中 Meta が1位なのは MCP Atlas の1枚だけ。残り6枚は Opus 5 が上**。自社発表資料で自社を2位以下に置き、比較相手に Claude Fable 5 まで入れている
- GPU カーネル最適化は**最長24時間・千回超のツール呼び出し**を無人で走らせる条件。FlashAttention 等の既存カーネルライブラリ読み込みを禁止し Triton で自力実装させる(NVIDIA Hopper の KDA/MLA カーネル)。上位4つはいずれもベースライン比6割以上の高速化
## 価格(2段階・ここが本題)
| | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 |
| **Contributor** | **$0.10** | **$0.002** | **$0.20** |
| (参考)Opus 5 | $5 | — | $25 |
| (参考)Haiku 4.5 | $1 | — | $5 |
- 100万トークンあたり。両者の**違いは「製品改善に使う/使わない」の一点だけ**で、入力12.5倍・出力21.25倍の差
- Contributor 版は Anthropic の最小モデル Haiku 4.5 より入力で1/10・出力で1/25 安い
- コンテキスト長はどちらも100万トークン
- 安さの対価に渡すのは**開発者が一番渡したくないコード**。データフライホイール戦略
## 考察(AI時短ラボが「ここからは考察」と明示した部分)
コーディングエージェントは乗り換えコストが高い。性能で1位を取れない後発が取った手は3つ ①素の価格 ②データと引き換えの追加値引き ③乗り換え摩擦の低減(クックブックの筆頭が **OpenAI SDK 互換クライアントで Meta のモデル API を叩く形**=向け先だけ変えて試せる)。「安さの出所を一度確かめる」は他分野にも効く判断基準。
---
## ⚠️ 信頼度メモ(重要)
ワンダー佐藤源彦サテライト(37再生・AI生成解説)の以下は**公式ブログに記載が無く裏取りできなかった**。引用しないこと:
- 「隔離された Git worktree で Worker が並行開発し Reviewer が検証」— worktree/reviewer の語は公式ブログに無い
- 「Grok 4.5 比で最大50%多くトークンを消費」「TTFT が平均20〜21秒」「安全フィルタが敏感でスタブを吐く」— いずれも公式に記載なし
一次ソースを持たない解説チャンネルは、構造の説明が上手いほど**未検証の数値が紛れ込む**。数字は必ず一次ソースへ戻る。
## 我々への含意
- Muse Code の付属スキルが `/plan` `/grill` `/goal` の3点セットなのは、当環境の `plan` / `grill-me` / `goal-judge` と**発想が一致**している。「計画を作る→叩く→走らせる」は業界の収束点になりつつある
- 「モデルとハーネスを一体で学習させる」は個人では真似できないが、**ハーネスの実行履歴を良し悪し込みで残す**(=イベントログを唯一の正とする)設計は模倣できる。当環境の agentd 台帳・discord_audit と同じ方向
Meta Muse Code / Muse Spark 1.2 — ハーネス共同学習と2段階価格 2026-08-05