Metaは2026年8月5日、常駐型サブエージェントを備える「Muse Code」ベータ版を公開しました。
- 要点1: macOSとLinuxに対応し、計画、実装、検証をターミナルで実行
- 要点2: ローカルイベントログにより、クラッシュ後も中断地点から再開
- 要点3: 企業導入では権限、データ利用条件、従量課金の確認が必要
対象: AI開発支援を検討する経営者、開発責任者、DX推進担当者
今日やること: 読み取り中心の小規模リポジトリでPoC対象を1件決める
この記事の目次
Metaは2026年8月5日、ターミナル型コーディングエージェント「Muse Code」のベータ版と、基盤モデル「Muse Spark 1.2」を発表しました。
特徴は、複数のサブエージェントがセッション中に常駐し、調査や検証を非同期で進める設計です。長時間の開発作業を止まりにくくする一方、企業利用では権限とログ、入力データの扱いを先に決める必要があります。
この記事では、Metaの公式発表をもとに、機能、性能、料金、企業が安全に試す手順を簡潔に解説します。
MetaがMuse CodeとMuse Spark 1.2を発表
Muse Codeは、大規模なリポジトリを対象に、変更計画の作成、コード記述、結果検証を進めるAIコーディングエージェントです。macOSとLinuxに対応し、Metaはベータ版として提供を始めました。
基盤となるMuse Spark 1.2は、Muse Spark 1.1のコーディング特化アップデートです。Metaによると、コード生成だけでなく、複雑なデバッグ、コードベースの理解、開発工程全体の処理を改善しています。
| 項目 | 発表内容 |
|---|---|
| 製品 | Muse Code(ベータ版) |
| 基盤モデル | Muse Spark 1.2 |
| 対応OS | macOS、Linux |
| 主な処理 | 計画、実装、デバッグ、検証 |
| 提供先 | Muse Code、Meta Model API |
| 発表日 | 2026年8月5日 |
Metaの公式発表では、インストール用のコマンドも公開されています。ただし、業務端末でそのまま実行する前に、情報システム部門が通信先、権限、保存ログを確認するのが安全です。
Muse Codeの3つの特徴
Muse Codeの差は、単に新しいモデルをターミナルから呼び出せることではありません。長時間の作業を複数のエージェントで継続するために、実行基盤まで一体で設計されています。
常駐する非同期バックグラウンドエージェント
一般的なサブエージェントは、必要になるたびに起動し、タスクが終わると停止します。Muse Codeのバックグラウンドエージェントは、セッション中に常駐します。
同じリポジトリ情報を何度も集め直す処理を減らし、主エージェントとは別に調査や次の工程を進められる設計です。複数工程にまたがる改修や、検証待ちが発生する作業で効果を見込めます。
ただし、並列処理が増えるほど、意図しないファイル変更やツール実行を見落としやすくなります。企業のPoCでは、書き込み可能な範囲を対象リポジトリ内に限定する必要があります。
再開可能なローカルイベントログ
Muse Codeは、モデル呼び出し、ツール実行、承認、編集をローカルイベントログに追記します。Metaはこのログを実行状態の単一の記録として扱い、クラッシュ後も停止した地点から再開できると説明しています。
長いタスクを最初からやり直さずに済む点は、運用コストの削減につながります。一方で、ログにソースコードやプロンプトが含まれる可能性を考え、保存先、閲覧権限、保管期間を社内規程に合わせる必要があります。
計画と検証を支える標準スキル
Muse Codeには、3つの標準スキルが用意されています。
| スキル | 役割 |
|---|---|
/plan |
タスクを人間の承認付き計画に変換する |
/grill |
計画の弱点や破綻条件を検証する |
/goal |
指定した目標の達成に向けて作業する |
企業では、最初から/goalに広い権限を与えるより、/planで変更内容を確認し、人間が承認してから実行する流れが適しています。AIの自律性を高める前に、停止点を作る運用です。
\ Claude Codeの導入、何から始めればいいかわかります /
法人様のAI導入に関するご相談はこちらMuse Spark 1.2の性能と評価の読み方
MetaはMuse Spark 1.2をMuse Codeと共同学習し、長時間の開発タスクに重点を置いたと説明しています。リポジトリ全体の生成、大規模プロジェクト、自動調査などを訓練対象に含めました。
公式発表では、最大24時間、1,000回を超えるツール呼び出しを通じて、NVIDIA Hopper向けGPUカーネルを反復的に最適化した事例も示されています。短いコード補完より、計画と検証を繰り返す処理を想定した設計です。
Metaが掲載した主な評価値は次の通りです。
| 評価 | Muse Spark 1.2とMuse Code |
|---|---|
| Terminal-Bench 2.1 | 82.9% |
| DeepSWE 1.1 | 59.3% |
| Meta Internal Coding Bench | 70.6% |
この数字だけで自社に最適と判断するのは早計です。公式評価手法では、各モデルをClaude Code、Codex、Antigravityなど異なるエージェント製品と組み合わせています。モデルだけでなく、実行基盤、推論設定、ツール構成も結果に影響します。
PoCでは、自社の実際のタスクを10件ほど選び、完了率、レビュー修正量、実行時間、APIコストを同じ条件で測る方法が現実的です。
Claude Code、Codex CLIとの違い
Claude CodeとCodex CLIも、ターミナルからリポジトリを読み、コードの修正やテストを行うAIコーディングエージェントです。Muse Codeは同じ市場に、常駐型サブエージェントと再開可能なイベントログを前面に出して参入しました。
| 比較軸 | Muse Code | 企業が見るべき点 |
|---|---|---|
| サブエージェント | セッション中に常駐 | 並列処理の速度と監督負荷 |
| 実行履歴 | ローカルイベントログ | 監査、保管、機密情報の扱い |
| 計画検証 | /planと/grillを標準搭載 |
承認フローへの組み込みやすさ |
| 基盤モデル | Muse Spark 1.2 | 自社コードでの品質とコスト |
| 提供状況 | ベータ版 | 仕様変更とサポート範囲 |
比較では、公開ベンチマークの順位より、既存のGit運用、CI、権限管理に無理なく接続できるかを優先すべきです。Codex CLIの導入方法は、Codex CLIの使い方ガイドでも解説しています。
AIコーディングエージェントの選定や安全なPoC設計にお悩みの場合は、業務とセキュリティ要件の整理から支援できます。
\ 業務自動化のお悩み、プロが30分で整理します /
法人様のAI導入に関するご相談はこちら企業が活用しやすい3つの業務
Muse Codeは、成果物と検証条件を明示できる開発業務から試すのが適しています。
1. 複数ファイルにまたがる小規模改修
API変更に伴う型定義、呼び出し元、テストの更新などは、調査範囲が広がりやすい作業です。常駐サブエージェントが依存関係の調査とテスト確認を分担できる可能性があります。
2. 不具合の再現と修正候補の作成
再現手順、期待値、対象テストを渡し、原因調査と修正案の作成を任せます。本番反映は人間が行い、AIには修正ブランチと検証結果までを担当させると境界が明確です。
3. 長時間の性能改善
MetaのGPUカーネル事例のように、実装、計測、修正を何度も繰り返す仕事と相性があります。ただし、計算資源とAPI利用が増えやすいため、時間と予算の上限を先に設定します。
導入前に確認したい制約と安全対策
Muse Codeはベータ版です。機能の豊富さより先に、次の5項目を確認してください。
- 権限: 本番環境、秘密情報、外部公開操作へのアクセスを切る
- 承認: ファイル書き込み、コマンド実行、外部通信に人間の承認点を置く
- ログ: ローカルイベントログの保存場所と閲覧者を限定する
- データ条件: 利用枠ごとの入力データの扱いを最新規約で確認する
- コスト: トークン、処理時間、再試行回数に上限を設ける
報道によると、標準のMuse Spark 1.2は100万トークン当たり入力1.25ドル、出力4.25ドルです。低価格のcontributor tierは、データ利用条件が標準枠と異なると報じられています。料金と条件は変更される可能性があるため、契約時点のMeta公式画面を正としてください。
また、AIが生成したコードは、正しく動くことと安全であることが一致しません。テストに通っても、ライセンス、脆弱性、保守性、社内設計規約は別に確認する必要があります。
\ AI活用の「次の一手」を一緒に考えませんか /
法人様のAI導入に関するご相談はこちら企業が今すぐ始めるPoC手順
PoCは、1つの小規模リポジトリと1つの評価表から始めます。
- 本番データを含まない検証用リポジトリを用意する
- バグ修正やテスト追加など、正解を判定できるタスクを10件選ぶ
- 読み取り中心の権限で開始し、変更前に
/planを確認する - 完了率、レビュー修正量、時間、費用、危険な操作件数を記録する
- 人間のみで行った場合と比較し、対象業務を広げるか判断する
最初の評価で見るべき指標は、生成コード量ではありません。レビュー後に採用できた変更の割合と、開発者が確認に費やした時間です。速度が上がってもレビュー負荷が増えれば、チーム全体の生産性は改善していません。
よくある質問
Q. Muse Codeは無料で使えますか?
Muse Code自体はベータ版として提供されていますが、基盤モデルの利用にはAPIの従量課金が発生します。利用前にMetaの最新料金表と利用条件を確認してください。
Q. Muse CodeはWindowsに対応していますか?
2026年8月5日のMeta公式発表では、インストール対象としてmacOSとLinuxが案内されています。Windows対応は公式発表の対象に含まれていません。
Q. Claude CodeやCodex CLIより高性能ですか?
一律には判断できません。Metaの評価では異なるモデルとエージェント製品を組み合わせており、実務の言語、リポジトリ規模、権限、テスト環境でも結果が変わります。自社タスクで同条件のPoCを行う必要があります。
Q. 企業のソースコードを安全に扱えますか?
安全性は製品機能だけで決まりません。利用枠のデータ条件、アクセス権限、ログ保管、秘密情報の除外、人間のレビューを組み合わせて運用してください。
まとめ
Muse Codeは、常駐する非同期サブエージェントと再開可能なローカルイベントログを備え、長時間の開発タスクを意識したコーディングエージェントです。Muse Spark 1.2との共同学習や標準スキルも、計画から検証までを一つの流れで扱う設計を示しています。
企業はベンチマークだけで選ばず、権限、データ利用条件、レビュー工数、APIコストを自社タスクで測るべきです。まずは機密情報を含まない小規模リポジトリで、承認付きのPoCから始めるのが妥当です。
AIコーディングエージェントの導入を支援します
株式会社Nexaでは、最新AIツールの選定、PoC設計、社内ルール整備を支援するAI顧問サービスを提供しています。自社の開発工程に合う使い方を、業務と安全性の両面から整理します。


