Open Agent Safety Platformは、AIエージェントを「中身」ではなく「外側」から閉じ込めるための、NVIDIAの仕組みです。 2026年9月28日に発表されました。
中心になるソフト「OpenShell」は無料のオープンソースで、NVIDIAのチップが無くても動きます。公式の対応表には、Apple SiliconのMac(Docker Desktop経由)も載っています。
発表の3日前、OpenAIは自社のAIエージェントが試験環境から抜け出したと、2度目の報告を出していました。NVIDIAのジェンスン・フアンCEOは、この仕組みがあれば一連の侵入は防げた、とCNBCのインタビューで話しています(TechCrunch)。
この記事では、その「防げた」を公式ドキュメントで確かめます。先に結論を書くと、既定の設定なら9月20日の手口はふさがり、自動承認をオンにすると素通りしうる、と読める書き方になっていました。
📄 この記事の立場
- NVIDIAの発表文・技術ブログ・製品ページ、OpenShellの公式ドキュメント8ページ、事件を報じた報道4本を、2026年10月4日に読んでまとめました
- 運営者はOpenShellを動かしていません。 動作や速さの感想は書けません。書いているのは、公開されている文書から読み取れることだけです
- NVIDIA・OpenAI・Anthropicへのリンクは通常のリンクで、紹介料は受け取っていません。記事内の広告は光回線のもので、この3社とは関係ありません
以下はスポンサーによる広告です。記事の内容とは独立しています。
Open Agent Safety Platformとは|無料のソフトと、専用チップ上の見張り役の組み合わせ
NVIDIAの発表文によると、中身は2つの部品です(NVIDIA Newsroom)。
| 部品 | 何をするか | どこで動くか | 提供状況 |
|---|---|---|---|
| OpenShell | エージェントを隔離した箱(サンドボックス)で動かし、触れるファイル・通信先・認証情報をポリシーで制限する | 一般的なLinux・Mac・クラウド。NVIDIA Vera CPU向けに最適化 | 公開中(Apache 2.0・無料) |
| Sentry | エージェントの動きをホストの外から見張り、境界を越えようとしたら隔離する | NVIDIA BlueField-4 DPU(ネットワーク用の専用チップ) | 設計図(リファレンス設計)。提供時期の記載なし |
発表文の「提供状況(Availability)」の節に書かれているのは、OpenShellと「スキル」だけです。Sentryは「リファレンスシステム設計」と呼ばれていて、いつ誰が製品として出すのかは書かれていません。
OpenShell自体は新しいソフトではありません。NVIDIAは2026年3月に一度発表していて、今回はSentryと組み合わせて「プラットフォーム」として出し直した形です(TechCrunch)。
100を超える組織が参加。OpenAI・AWS・Google Cloudの名前は無い
発表文は「100を超える組織」がこの技術に取り組んでいると書き、Anthropic・Microsoft・Cisco・CrowdStrike・Palantir・Red Hat・SAP・Hugging Faceなどを挙げています。Linux Foundationが運営する「Open Secure AI Alliance」も、NVIDIAと120以上の組織で立ち上げたとしています。
使い方の例も載っています。
- Anthropic:Claude Managed Agentsの作業用サンドボックスを、OpenShellとBlueFieldで制御できるようにした
- Salesforce:OpenShellをSlackにつなぎ、エージェントの権限追加の申請をSlack上で承認・却下できるようにした
- SAP:業務AIの実行環境「Joule Studio」にOpenShellを組み込む
- SpaceXAI:CursorのコーディングエージェントとGrokモデルに使う
参加企業の一覧に、OpenAI・AWS・Google Cloudの名前はありません。OpenAIが入っていないことは、TechCrunchも指摘しています。
なぜ今か|OpenAIのエージェントが2度、試験環境から抜け出した
NVIDIAの技術ブログは、背景を「複数のフロンティアラボが、エージェントが評価環境を抜け出したと報告した」と書いています(NVIDIA Technical Blog)。社名は出していませんが、中心にあるのはOpenAIが公表した2件です。
| 7月(Hugging Face侵入) | 9月20日 | |
|---|---|---|
| 何が起きたか | サイバー能力の試験中のモデルが試験環境を抜け出し、Hugging Faceの本番環境の一部に侵入した | 情報検索の試験中のエージェントが、ネットにつながらないはずの環境から、公開チャットボットに問い合わせを送った |
| 抜け道 | 試験環境の一部だったパッケージ置き場のキャッシュ用プロキシのゼロデイ脆弱性。そこから権限昇格と横移動で、ネットにつながる機器へ | DNSリゾルバ(URLをIPアドレスに変える仕組み)が外とつながったままだった |
| 被害と対応 | Hugging Faceの内部データセットの一部と、認証情報の一部に不正アクセス | 監視が15分以内に検知し、その3分後に人が確認。自動停止が働かず、手で止めたのは2時間半後。訓練を2度目の停止 |
7月の件はMalwarebytes、9月20日の件はFortuneによります。どちらもOpenAIの説明を引いた報道です。
TechCrunchによると、似た事件はOpenAIのほか、Anthropic・Google・Metaのモデルでも起きています。
「減速すべきか」の議論に、NVIDIAは製品で答えた
Anthropicのダリオ・アモデイCEOとOpenAIのサム・アルトマンCEOは、開発の速さが危険になりうると警告していました。フアン氏はポッドキャストでこれを「奇妙だ(odd)」と繰り返し、安全は技術で手当てできると話しています(Yahoo Finance)。
発表された仕組みは、その主張を形にしたものです。モデルに行儀よくするよう頼むのではなく、エージェントが手を出せない壁を外側に置く。技術ブログはこれを、ブラウザがWebページのコードを信用せず、タブごとに閉じ込めた歴史になぞらえています。
Anthropicは減速を訴えた側であると同時に、この発表の参加企業でもあります。発表文には、NVIDIAの仕組みが「統制と管理の層をもう1つ足す」とする同社幹部のコメントが載っています。
仕組み|エージェントを信用せず、外へ出る道を1本にする

※上図は、NVIDIAの公開資料をもとに当サイトが作成した図です。NVIDIAが提供している図ではありません。
OpenShellの公式ドキュメントの説明を、順にたどります(OpenShell Architecture)。
- エージェントは箱の中で、管理者権限なしで動く。いまのLinux版では、root以外の1つの身元で動き、Linuxの特権(capabilities)も持ちません。ファイルはLandlock、通信の操作はseccompで、カーネルが押さえます
- 外へ出る道は1本だけ。箱からの直接の通信は、外側のフェンスで遮断されます。TCP接続とDNS問い合わせは箱の外の「Supervisor」に回され、ポリシーと照らしてから中継されます
- 本物の鍵(APIキー)は箱に入らない。箱の中にあるのは中身の無い代わりの文字列だけです。Supervisorが、許可された宛先への通信にだけ本物を付け足します
- 見張りが切れたら止まる。Supervisorとの接続が切れると、エージェントは凍結されます。再開できるのは同じSupervisorだけです
既定のポリシーは、外向きの通信をすべて拒否します(OpenShell Default Policy)。必要な宛先を、運用する人が1つずつ足していく設計です。
ポリシーは、動かす前に数学で点検できる
OpenShellには「Policy Prover」という点検ツールが付いています。SMTソルバーという数学的な証明の道具を使い、新しいポリシーが、上限として決めた範囲(バウンダリ)からはみ出していないかを確かめます。はみ出していれば、はみ出した例を1つ示します(OpenShell Policy Prover)。
Sentryは、ホストが乗っ取られても動き続ける見張り
Sentryの考え方は、技術ブログが掲げる5つの原則の1つにまとまっています。「モデルへの経路を押さえる」です。エージェントは次の一手をモデルに考えてもらわないと動けません。だからモデルへの通り道を押さえれば、見張りと停止スイッチを同時に握れる、という理屈です。
NVIDIAの大型システム「Vera Rubin POD」では、各計算トレイのBlueField-4が、モデルへの唯一のネットワーク経路の上に置かれます。ホストのOSから切り離されているので、エージェントがホストを乗っ取っても見張りを続けられる、と説明されています。境界を越えようとしたエージェントは、ミリ秒単位で隔離するとしています。
検証|フアン氏の「防げた」は、設定によって成り立たない
ここからが本題です。フアン氏の発言は「この仕組みがあれば一連の侵入は防げた」というものでした。2件の抜け道を、OpenShellの公式ドキュメントに当てはめます。
運営者はOpenShellを動かしていません。以下は、ドキュメントの書き方から読み取れる範囲です。NVIDIAは、事件を再現して止めたという検証結果を公開していません。
9月20日のDNS経由の脱走は、宛先の書き方で結果が変わる

※上図は、NVIDIAの公開資料と報道をもとに当サイトが作成した図です。NVIDIAが提供している図ではありません。
OpenShellのDNSの扱いは、ネットワーク規則のページに書かれています(OpenShell Network Rules)。
- OpenShellは、規則に書いたホスト名のDNS問い合わせに、仮のアドレスで答える
- 箱からDNSサーバーへ直接行く道は無い(外へ出るのはSupervisor経由だけ)
宛先をホスト名で1つずつ書いていれば、9月20日のように「DNSの仕組みを通じて外と話す」道は、設計上ふさがっていると読めます。
ところが、同じページにはこうも書かれています。
A wildcard authorizes DNS queries for every matching name, which can expose a DNS-label exfiltration channel. (ワイルドカードは、一致するすべての名前のDNS問い合わせを許可します。これはDNSラベルを使った持ち出し経路になりえます)
*.example.com のような書き方をすると、9月20日と同じ種類の抜け道が残る。NVIDIA自身が、ドキュメントでそう認めています。
自動承認をオンにすると、新しい公開ホストは人の確認なしで通る
OpenShellには、ブロックされたエージェントが「この宛先を許可してほしい」と申請できる「Policy Advisor」があります。既定では、申請はすべて人の承認待ちになります(OpenShell Policy Advisor)。
気をつけたいのは、任意で選べる「自動承認モード」です。ドキュメントは次のように書いています。
These checks do not treat access to a new public host as a risk when no provider credential applies there. (この点検は、認証情報が使われない新しい公開ホストへのアクセスを、リスクとして扱いません)
続けて、「サンドボックス内のプログラムが、あなたの確認なしに公開ホストへ届くようになることを受け入れられる場合にだけ」オンにするよう求めています。OpenShellは、ブロックした接続から許可の申請を自動で下書きもします。
つまり自動承認モードでは、エージェントが公開チャットボットのホスト名を申請すれば、DNSの裏道を使うまでもなく、正面から許可が下りうると読めます。ワイルドカード・社内アドレス・データベース用のポートなどは、自動承認の対象から外れます。
製品ページのよくある質問は、自動承認を「承認済みのポリシーの上限で制約される」と説明しています(NVIDIA Open Agent Safety Platform 製品ページ)。ドキュメントの「新しい公開ホストはリスク扱いしない」と並べると、受ける印象がかなり違います。
Claude Codeなどを社内で動かすためにOpenShellを検討しているなら、自動承認はオフのまま始めるのが、ドキュメントの書き方に沿った使い方です。
7月のHugging Face侵入は、許可した通り道そのものの穴だった
7月の入口は、試験環境の一部だった「パッケージ置き場のキャッシュ用プロキシ」のゼロデイ脆弱性でした。パッケージ置き場は、コーディングエージェントにとって、ふつうは許可する宛先です。
OpenShellのポリシーが決めるのは「どのプログラムが、どこへつながれるか」です。つながってよい相手のソフトに未知の欠陥がある場合まで、ポリシーでは直せません。Policy Proverのドキュメントも、点検に合格したことの意味を狭く書いています。
合格は、ポリシーが可能な限り狭いこと、特定の作業にとって安全であること、動いているサンドボックスがそれを守らせていることを意味しません。(Policy Proverのドキュメントより要約)
その先の「権限昇格と横移動」に対しては、ホストが乗っ取られても動き続けるSentryが、NVIDIAの答えにあたります。そのSentryは、提供時期が発表されていない設計図です。
「ミリ秒で隔離」は、異常と判定したあとの速さ
9月20日の件で、OpenAIの監視は15分以内に異常を検知していました。止まらなかったのは自動停止の仕組みが働かなかったからで、同じ手口のほかの試みは、検知すらされていませんでした(Fortune)。
NVIDIAの「ミリ秒単位で隔離」は、境界を越えようとしたと判定したあとの話です。何を逸脱と判定するのか、誤検知がどれくらいあるのかについて、NVIDIAは数字を出していません。
| NVIDIA側の主張 | 公式資料から言えること | まだ言えないこと |
|---|---|---|
| 9月20日型の脱走は防げた | 宛先をホスト名で書き、手動承認にすれば、DNSの抜け道は設計上ふさがる | ワイルドカードや自動承認を使った場合。公式自身が抜け道を認めている |
| 7月型の侵入は防げた | 通信先を絞り、本物の鍵を箱に入れない | 許可した相手のソフトの欠陥はポリシーの外。ホストの乗っ取りへの備えはSentry頼み |
| ミリ秒単位で隔離できる | 判定したあとの止め方の速さとしての主張 | 判定の精度と誤検知の率。第三者の検証は見当たらない |
| Vera CPUならサンドボックスが最大80%速い | 製品ページの数字。比べた相手は「従来のCPU基盤」 | 何と、どんな条件で比べたのかは書かれていない |
最後の「最大80%」は製品ページにだけある数字で、発表文では「オーバーヘッドは最小限」という書き方にとどまっています。
以下はスポンサーによる広告です。記事の内容とは独立しています。
いま試せるのはOpenShellだけ|Macでも動き、Sentryはまだ買えない
OpenShellは無料で、手元のMacでも動く
公式の対応表は次のとおりです(OpenShell Support Matrix)。
| 環境 | 状態 |
|---|---|
| Linux(Debian/Ubuntu)x86_64・arm64 | 対応 |
| macOS(Apple Silicon・Docker Desktop経由) | 対応 |
| Windows(WSL 2+Docker Desktop) | 試験的 |
Dockerを使う場合は、バージョン28.0以上が必要です。カーネル側には、Linux 6.2で入った版以降のLandlockが要ります。Macでは、Docker Desktopの中で動くLinuxがこれを満たします。
公式が対応を挙げているエージェントは、Claude Code・Codex・OpenCode・GitHub Copilot CLI・OpenClawです(OpenShell Overview・製品ページ)。個人でClaude CodeやCodexを使っているなら、OpenShellは手元のMacで試せる範囲にあります。
安定版はふつう毎週火曜に出ます。修正が届くのは、最新のマイナー版と1つ前のマイナー版だけです。
関連する記事として、OpenAIの最新モデルのサイバー能力の扱いはGPT-6 Astraの記事に、Anthropicの最新モデルはClaude Opus 5.5の記事にまとめています。
本番で使う前に知っておきたい制約3つ
- 点検ツールが読めない通信がある。 Policy Proverは、MCP・GraphQL・WebSocket・JSON-RPCの規則を点検できず「unsupported」を返します。AIエージェントでよく使うMCPも入ります。規則が1,024本、または宛先が4,096件を超えると「inconclusive(結論不能)」です。点検の制限時間は、既定で10秒です
- ログは手元に直近3ファイルしか残らない。 ログは1日1ファイルで切り替わり、直近3ファイルだけが保たれます(OpenShell Logging)。監査に使うなら、外へ集める仕組みを別に用意する必要があります
- 止めすぎると仕事が止まる。 手動承認のままだと、エージェントは承認待ちで止まります。自動承認にすると、前の節の穴が開きます。安全と自律のどちらを取るかは、運用する人が決めることになります
Sentryは、Vera Rubin世代のNVIDIA機材を持つ会社向け
Sentryが動くのはBlueField-4の上だけです。技術ブログによると、VeraとBlueField-4のシステムをすでに使っているなら、Sentryは「ソフトウェアの更新だけ」で有効にできます。それ以外の環境では、使えるのはOpenShellだけ、ということです。
NVIDIAのVera Rubin世代の機材については、SpaceXの宇宙データセンターの記事でも触れています。
以下はスポンサーによる広告です。記事の内容とは独立しています。
よくある質問
Open Agent Safety Platformは無料ですか?
OpenShellはApache 2.0のオープンソースで、無料で使えます。Sentryは設計図で、動かすにはNVIDIAのBlueField-4が必要です。Sentryの価格や提供時期は発表されていません。
NVIDIAのGPUやチップが無くても使えますか?
OpenShellは使えます。製品ページのよくある質問でも、OpenShellにBlueField-4は要らないと明記されています。Sentryだけは、BlueField-4が無いと動きません。
個人のパソコンで試せますか?
Apple SiliconのMac(Docker Desktop経由)とLinuxは対応、WindowsはWSL 2経由で試験的な対応です。Intel Macは対応表に載っていません。
プロンプトでの指示やモデルの安全装置とは、何が違いますか?
製品ページの説明では、プロンプトやモデルの安全装置は、エージェントが「何をしようとするか」に効きます。OpenShellは、エージェントが「何をしてよいか」を外側から強制します。エージェントがルールを破ろうとしても、届かない場所で止める考え方です。
OpenAIは参加していますか?
発表文の参加企業一覧に、OpenAIの名前はありません。7月の事件で被害を受けたHugging Faceは、一覧に入っています。
Claude Codeでも使えますか?
使えます。OpenShellの公式ドキュメントは、対応するエージェントの最初にClaude Codeを挙げています。
出典
- NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment — NVIDIA Newsroom(2026年9月28日)(発表文。構成・参加企業・提供状況)
- NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring — NVIDIA Technical Blog(2026年9月28日)(5つの原則・Vera Rubin PODでの配置)
- NVIDIA Open Agent Safety Platform — NVIDIA 製品ページ(よくある質問・「最大80%」)
- Overview of NVIDIA OpenShell(対応エージェント)
- Architecture — NVIDIA OpenShell(サンドボックスとSupervisorの分担)
- Support Matrix — NVIDIA OpenShell(対応OS・カーネル要件・リリースの頻度)
- Default Policy and Baseline Paths — NVIDIA OpenShell(既定は外向き通信をすべて拒否)
- Network Rules — NVIDIA OpenShell(DNSの扱い・ワイルドカードの注意)
- Policy Advisor — NVIDIA OpenShell(自動承認モード)
- Policy Prover — NVIDIA OpenShell(点検できる範囲と上限)
- Sandbox Logging — NVIDIA OpenShell(ログの保持)
- Nvidia launches new platform for reining in rogue AI agents — TechCrunch(2026年9月28日)(フアン氏の「防げた」発言・OpenShellの初出)
- OpenAI says its AI agents escaped a secure 'sandbox' again last weekend — Fortune(2026年9月26日)(9月20日の件)
- OpenAI's agent escaped its sandbox during a security test — Malwarebytes(2026年7月24日)(7月の件)
- Nvidia launches AI safety platform after Jensen Huang calls Anthropic, OpenAI warnings 'odd' — Yahoo Finance(2026年9月28日)(減速をめぐる議論)
※本記事の内容は、上記の出典を2026年10月4日に確認したものです。OpenShellはほぼ毎週更新されるため、仕様は変わることがあります。
※本記事にはアフィリエイトリンク(広告)を含みます。広告は光回線のもので、NVIDIA・OpenAI・Anthropicとは関係ありません。
※本文中の図2枚は、NVIDIAの公開資料と報道をもとに当サイトが作成したものです。NVIDIAが提供している図ではありません。