公開日:
Muse Spark 1.3は2026年9月2日に発表され、長期エージェント業務の改善が示されました。
- 要点1: Muse CodeとMeta Model APIで提供を開始
- 要点2: Meta社内比較でtool callsは約20%、tokensは約25%減少
- 要点3: 企業導入ではtierのデータ条件と人間承認の確認が必要
対象: AIエージェントの導入を検討する経営者、DX推進担当、情報システム部門
今日やること: 公開情報だけで試せる代表タスクを3件選ぶ
この記事の目次
Metaは2026年9月2日、長期のエージェント業務とコーディングを重視したMuse Spark 1.3を発表しました。企業にとっての注目点は、単発の回答性能よりも、複数工程をまたぐ仕事で指示を保ち、必要な場面で利用者へ確認する設計です。
ただし、Metaの性能値はそのまま自社の削減率にはなりません。導入判断では、データ利用条件を確認し、権限を絞ったPoCで品質、コスト、安全性を測る必要があります。
Muse Spark 1.3は2026年9月2日に発表
Metaの公式発表によると、Muse Spark 1.3は発表日からMuse CodeとMeta Model APIで提供されています。既存のreasoning modesは利用できますが、max reasoningは追加の安全性テストを終えた後に提供される予定です。
ここは提供中の機能と予告された機能を分けて読む必要があります。公式の評価資料にmax reasoningの結果があっても、発表時点で全利用者が同じ設定を使えるとは限りません。
Muse CodeとMeta Model APIの使い分け
Muse Codeの公式Docsは、Muse CodeをターミナルとCIで動くコーディングエージェントと説明しています。プロジェクト内で計画を作り、ファイルを編集し、コマンドを実行します。承認機能とOSレベルのsandboxも備えます。
一方、Meta Model APIは、独自の業務アプリやエージェントへモデルを組み込むための手段です。既製の開発エージェントを試すならMuse Code、業務フローや画面を自社で設計するならMeta Model APIが候補になります。
Muse Spark 1.2から何が変わったのか
Metaは、Muse Spark 1.3が長期タスクを持続し、一つの長いスレッドで複数のワークフローを扱えるよう改善したと説明しています。乱雑または矛盾した情報源からツールで文脈を組み立て、計画の不足を補正し、得た情報を成果物へまとめることを想定しています。
利用者との協働にも変更があります。指示が曖昧なら質問し、行き詰まれば助けを求め、重大な操作の前には確認します。過去の依頼への追加指示や、途中で割り込んだ別タスクを正しい作業へ対応づける能力も改善したというのがMetaの説明です。

約20%と約25%はMeta社内比較
コーディングでは、MetaのエンジニアによるMuse Spark 1.2との比較で、tool callsが約20%少なく、使用tokensが約25%少なかったと報告されています。不要なターンと冗長な出力を減らした結果として示された数値です。
しかし、これは独立機関が全業務で再現した削減率ではありません。tool callsが減っても、人間による修正や再実行が増えれば総工数は下がらないためです。公式の評価方法も、第三者モデルの比較はbest-effortで、promptやtools、runtimeが各モデル向けに最適化されていない可能性を記載しています。

\ AI導入の進め方を一緒に整理しませんか /
AI顧問の無料相談はこちら企業業務への影響は長期エージェントで表れる
Muse Spark 1.3の差が表れやすいのは、資料を一度作って終わる仕事より、調査、判断、実行、検証を繰り返す仕事です。企業では次の用途が候補になります。
| 業務 | エージェントに任せる範囲 | 人間が確認する点 |
|---|---|---|
| ソフトウェア開発 | 調査、修正案、テスト実行、結果整理 | 仕様適合、セキュリティ、本番反映 |
| 市場調査 | 複数ソースの収集、矛盾整理、報告書作成 | 出典、鮮度、意思決定への利用可否 |
| コンテンツ運用 | 下書き、WordPress入稿前の形式確認 | 事実、権利、公開承認 |
| 定型オペレーション | 複数システムの照合、候補作成 | 送信、削除、決済、権限変更 |
Claude CodeやCodex CLIを既に使っている企業が、発表だけを理由に全面移行する必要はありません。同じリポジトリ、同じ権限、同じ完了条件で代表タスクを実行し、完成物の品質と手戻りを比較する方が判断しやすくなります。
大きなコンテキストや少ないtool callsは入力指標です。業務で見るべき出力指標は、利用者が承認できる成果物を、事故なく、どれだけ少ない再作業で得られたかです。
導入は代表タスクPoCから始める
最初のPoCでは、頻度が高く、正解条件を定義でき、失敗しても本番へ影響しないタスクを3〜5件選びます。公開情報または合成データを使い、既存ツールと同じ条件で比べます。
評価項目を実行前に固定する
| 評価項目 | 測り方 |
|---|---|
| 成果物品質 | 要件を満たした項目数と、人間が修正した箇所数 |
| 完了率 | 定義した終了条件まで到達した件数 |
| 効率 | tool calls、input/output tokens、所要時間 |
| 手戻り | 再指示、再実行、差し戻しの回数 |
| 安全性 | 承認前に停止できたか、禁止操作を試みなかったか |
| 監査性 | prompt、tool call、結果、承認者を追跡できるか |
比較では平均値だけでなく、失敗例を残します。正常時に速いモデルでも、例外時に誤った操作を続けるなら、本番業務の候補にはできません。曖昧な依頼を与えた際に質問へ戻れるか、重大操作の直前で止まれるかも試験項目に含めます。
Muse Spark 1.3を含むAIエージェントの評価設計や、業務に合うツールの選び方を整理したい企業は、Nexaへご相談ください。
\ 業務自動化のお悩みをAI顧問に相談できます /
AI顧問の無料相談はこちら1,048,576 tokensとtierの条件を確認する
公式モデルDocsは、Muse Sparkファミリーのコンテキストウィンドウを1,048,576 tokensと記載しています。長い仕様書、ログ、複数ファイルを一度に扱える余地は広がりますが、入力した情報のすべてを正しく使う保証ではありません。
大量の文書を無選別に入れると、古い規程と新しい規程が競合し、判断根拠を追いにくくなります。文書の更新日、優先順位、参照範囲を付け、出典を成果物へ残す設計が必要です。
Standard tierとContributor tierの差
公式Docsでは、tierが料金だけでなくデータ利用条件を決めます。Standard tierのpromptsとcompletionsはMeta modelsの学習に使用されません。Contributor tierは、将来のMeta modelsの学習に使う許可と引き換えに、割引を受ける仕組みです。
| 確認項目 | Standard tier | Contributor tier |
|---|---|---|
| 学習への利用 | promptsとcompletionsを使用しない | 使用を許可する |
| 向く検証データ | 契約条件を確認した社内データ | 公開情報、合成データ |
| 導入時の注意 | 保存期間やアクセス制御も確認 | 機密情報を投入しない |
価格とrate limitsの公式Docsは、2026年9月3日の取得時点でモデル欄が1.1と1.2表記のままでした。1.3への更新が一部追いついていない可能性があるため、旧版の単価を1.3の確定価格として扱うのは避けます。契約前に1.3のmodel ID、tier、単価、rate limits、データ条件を最新画面で照合してください。
prompt injection対策はモデル外にも必要
MetaはMuse Spark 1.3について、adversarial inputsとprompt injectionsへの耐性が改善したと主張しています。不可逆な操作に対する判断も改善したという説明です。ただし、耐性の改善は攻撃や誤操作を防ぐ保証ではありません。
prompt injectionは、Webページやメール、文書内の命令を、エージェントが利用者の指示と誤認する攻撃です。外部情報を読みながらツールを操作する長期エージェントほど、モデルの判断だけに防御を任せることはできません。
権限と承認を別の制御層にする
企業運用では、次の制御を組み合わせます。
- エージェント用アカウントの権限を、タスクに必要な範囲へ限定する
- 公開、送信、削除、決済、権限変更は、人間が内容を見て承認する
- ファイル書き込みとネットワーク接続をsandboxで制限する
- prompt、参照元、tool call、実行結果、承認者を監査ログへ残す
- 外部コンテンツを命令ではなく未信頼データとして分離する

Muse Codeのpermissions Docsでは、approvalとsandboxが初期状態で有効です。両方を無効にする--yoloは、既に隔離された使い捨てCI環境だけを想定した選択肢です。モデルが確認を求める性質と、システムが操作を止める仕組みは別物として設計します。
\ AI活用の「次の一手」を一緒に考えませんか /
AI顧問の無料相談はこちらよくある質問
Q. Muse Spark 1.3はいつ、どこで利用できますか?
Metaは2026年9月2日に発表し、同日からMuse CodeとMeta Model APIで提供を始めたと案内しています。利用可能な地域、アカウント、model IDは、導入時に管理画面と最新Docsで確認してください。
Q. max reasoningはすぐ使えますか?
発表時点では、既存のreasoning modesが利用できます。max reasoningは、Metaが追加の安全性テストを終えた後に提供予定です。評価資料上の設定と、自社アカウントで選べる設定を混同しないことが大切です。
Q. Standard tierとContributor tierの違いは何ですか?
公式Docs上の主な違いは料金とデータ利用です。Standard tierではpromptsとcompletionsを学習に使わず、Contributor tierでは将来のMeta modelsの学習への利用を許可します。価格だけで選ばず、投入データの機密性から判断します。
Q. 1,048,576 tokensなら社内文書をすべて入れてよいですか?
推奨できません。長いコンテキストは容量であり、正確性や機密性の保証ではないためです。最新版の文書だけを選び、アクセス権、保存方針、出典表示、矛盾時の優先規則を設定してください。
Q. Claude CodeやCodex CLIから切り替えるべきですか?
発表内容だけでは判断できません。自社の代表タスクを同じ条件で実行し、成果物品質、手戻り、tokens、所要時間、安全停止を比較してください。全面移行より、対象業務を限定した併用試験が現実的です。
まとめ
Muse Spark 1.3は、長期タスク、複数ワークフロー、曖昧時の確認、重大操作前の確認を重視した更新です。Meta社内比較ではMuse Spark 1.2よりtool callsが約20%、tokensが約25%少ないと報告されましたが、自社業務での効果はPoCで確かめる必要があります。
企業が最初に決めるべきなのは、モデルの順位ではありません。Standard tierとContributor tierのデータ条件を確認し、権限最小化、人間承認、sandbox、監査ログを用意したうえで、公開情報を使う代表タスクから評価します。
一次情報:
- Introducing Muse Spark 1.3
- Muse Spark 1.3 Multimodal Evaluation Methodology
- Models
- Pricing and rate limits
- Muse Code
AIエージェントの導入と運用を支援します
株式会社NexaのAI顧問では、AIツールの選定からPoC、権限設計、社内定着まで伴走します。自社の代表タスクをどう切り出すか分からない段階からご相談いただけます。





