公開日:
NVIDIA AVOがARC-AGI-3公開セットで100%
NVIDIAは2026年8月21日、長時間動作する自律型AIエージェント基盤「AVO」が、ARC-AGI-3の公開範囲でRHAE 100.00を記録したと発表しました。対象はPublic SetとPublic Demoの25環境・183レベルで、基盤モデルにはClaude Opus 5が使われています。
ただし、非公開の競技セットを含む「完全攻略」ではなく、モデル単体の統制比較でもありません。本記事ではNVIDIAとARC Prizeの一次情報に限定し、評価条件と企業への示唆を整理します。
NVIDIA AVOはARC-AGI-3公開範囲の25環境・183レベルを完了し、RHAE 100.00を記録したと報告されました。
- 要点1: AVOは永続メモリや停滞検知を統合した長時間エージェント基盤
- 要点2: RHAE 100.00はNVIDIAの自己報告で、公開セットに限定
- 要点3: Claude Opus 5 Highの30.16%とは評価条件が異なり、直接比較は不可
対象: AIエージェント導入を検討する企業の経営者・DX担当者
今日やること: 自社PoCの成功率・再試行率・費用・人手介入率を定義する
この記事の目次
NVIDIA AVOの発表内容
NVIDIA公式ブログによると、AVOは「Agentic Variation Operators」の略称です。Claude Opus 5を使い、ARC-AGI-3のPublic SetとPublic Demoに含まれる25環境、合計183レベルを完了したと報告しています。
評価値はRHAE 100.00、完了までのenvironment actionsは6,624回です。いずれもNVIDIAが2026年8月21日に公表した、公開セット限定の自己報告です。調査時点ではARC Prize側にAVO専用のVerified結果は確認できないため、第三者検証済みとは表現できません。
タスクではゲームのルールや目標を事前説明せず、観測を64×64のテキストグリッドに変換します。画像自体はLLMへ送られません。エージェントは操作結果から仮説を立て、未知の環境を探索します。
ARC-AGI-3とRHAEが測るもの
ARC-AGI-3公式概要では、探索、計画、目標獲得、適応を扱うインタラクティブな評価と説明されています。静的な問題への一回答ではなく、行動と観測を繰り返す設計です。
ARC Prizeのmethodologyで示されるRHAEは、完了レベルと、人間基準に対する環境操作効率を反映します。RHAE 100.00は、NVIDIAが対象とした公開範囲でレベルを完了し、操作効率を含む基準に到達したという報告です。
ただし、RHAEは総コストを表しません。内部推論、ツール呼び出し、消費トークン、実時間、金銭的費用は含まれないため、「人間と同コスト」「最も安価」とは解釈できません。
\ AI導入の進め方を一緒に整理しませんか /
AI顧問の無料相談はこちらAVOはモデルではなく長時間エージェント基盤
AVOはClaude Opus 5へ一度指示して終わる構成ではありません。NVIDIAの説明では、長時間タスクを支える次の仕組みを統合しています。
- 永続メモリ:過去の観測、試行、仮説を保持する
- 状態保持:現在地や達成済み条件を追跡する
- ツール利用と反復ループ:観測、計画、実行、評価、修正を続ける
- 停滞検知supervisor:進展の停止を検知し、探索方針の変更を促す
成果は基盤モデルだけでなく、履歴保存、再計画、停滞からの復帰を含むシステム全体から生まれます。社内業務でも、状態が消える、同じ失敗を繰り返す設計では、長い処理を安定して完了できません。
30.16%との単純比較ができない理由
ARC PrizeのClaude Opus 5 High公式結果には30.16%が掲載されています。しかし、AVOの100.00と並べて、モデル能力や改善倍率を結論付けることはできません。
推論設定、観測表現、永続メモリ、コンテキスト、実行ループが同一ではないためです。NVIDIA自身も、AVOの純粋な効果を示す直接比較ではないと明記しています。30.16%対100.00を「約3倍」とする表現も、異なる評価構成の数値を単純に割るため不適切です。
なお、AVO論文は2026年3月25日投稿で、GPUカーネル最適化が主題です。今回のARC-AGI-3公開セットにおける100.00は含まれません。論文とブログ発表を混同せず、今回の数値はNVIDIA公式ブログを出典にする必要があります。
\ 業務自動化のお悩みをAI顧問に相談できます /
AI顧問の無料相談はこちら企業のAIエージェント導入への示唆
実務への示唆は、「高性能モデルだけで自律化できる」のではなく、「継続して働ける実行基盤が必要」という点です。
実行結果によるgroundingでは、AIの自己申告でなくAPI返却値、ファイル差分、テスト結果で成功を判定します。チェックポイントで途中状態を保存すれば、障害後に再開できます。最小権限で読み取り、下書き、送信、削除を分け、外部送信や削除、金銭処理には承認ゲートを設けます。入力、判断、ツール実行、結果、再試行を残す監査ログも必要です。
評価はモデルのベンチマーク値だけでなく、業務ごとの成功率、再試行率、費用、人手介入率を継続計測します。RHAEに内部推論や費用が含まれないのと同様、単一指標では運用品質を捉え切れません。
発表を読む際の注意点
RHAE 100.00の対象はPublic SetとPublic Demoの25環境・183レベルです。非公開の競技セットを含むARC-AGI-3全体の成績ではありません。AVO専用Verified掲載も調査時点で未確認であり、評価環境での成功からAGI達成を導くこともできません。
確認できるのは、NVIDIAの説明した条件下で、Claude Opus 5とAVOを組み合わせたシステムが公開範囲を完了したという自己報告です。再現可能性、実行コスト、非公開課題への汎化、他モデルでの効果には追加検証が必要です。強い数字ほど、対象範囲、出典、評価に含まれない要素を併記する必要があります。
\ AI活用の「次の一手」を一緒に考えませんか /
AI顧問の無料相談はこちらNVIDIA AVOのよくある質問
Q. NVIDIA AVOとは何ですか?
AVOはAgentic Variation Operatorsの略で、永続メモリ、ツール利用、状態保持、反復ループ、停滞検知supervisorなどを組み合わせた長時間エージェント基盤です。基盤モデル名ではありません。
Q. ARC-AGI-3を100%完全攻略したのですか?
いいえ。RHAE 100.00の対象はPublic SetとPublic Demoの25環境・183レベルです。非公開の競技セットを含む全課題の攻略やAGI達成を意味しません。出典はNVIDIAの2026年8月21日付公式ブログです。
Q. Claude Opus 5 Highの30.16%より優れていますか?
単純比較できません。30.16%はARC Prize公式結果ですが、AVOとは推論設定、観測表現、メモリ、コンテキスト、実行ループが異なります。100.00対30.16はAVO単体の効果を示す統制比較ではありません。
Q. 企業は何を参考にすべきですか?
モデル選定に加え、永続メモリ、停滞検知、実行結果の検証、チェックポイント、最小権限、承認ゲート、監査ログを設計します。導入後は成功率、再試行率、費用、人手介入率を業務単位で測ることが重要です。
まとめ
NVIDIAの自己報告によると、AVOはClaude Opus 5を用い、ARC-AGI-3の公開範囲にある25環境・183レベルを6,624 environment actionsで完了し、RHAE 100.00を記録しました。モデル単体よりも、記憶、状態管理、ツール実行、停滞からの復帰を統合した基盤の重要性を示す事例です。
ただし公開セット限定で、AVO専用Verified掲載は未確認です。30.16%との直接比較、AGI達成、全課題の完全攻略、同等コストという解釈は避けるべきです。企業では安全な権限、承認、監査、再開可能性を整え、成果と運用コストの両面で評価する必要があります。





