OpenAI は 2026 年 9 月 3 日木曜日に GPT-6 Astra をリリースし、その安全上の注意事項には警告ラベルが付いています。 OpenAIは、Astraは「サイバーセキュリティ機能のクリティカルレベルに到達した最初のモデル」であると、OpenAIは独自のリスクフレームワークについて書いている。つまり、適切なツールを使えば、「人が各ステップを指導することなく、これまで知られていなかったセキュリティ上の欠陥を発見し、十分に保護された多くのシステムにわたってそれを悪用する新しい方法を開発できる」ということだ。このモデルはまず、精査された少数の組織に提供され、ChatGPT Plus、Pro、Business、Enterprise プラン、アプリケーション プログラミング インターフェイス (API)、およびアマゾン ウェブ サービス (AWS) が「数日以内に」続きます。
OpenAI が冒頭で示した数値は、人工知能 (AI) がこれまでに見たことのないゲームのルールを解決できるかどうかをテストするために構築されたベンチマークである ARC-AGI-3 で 99.9% でした。テストを実施する団体であるARCプライズがそのスコアを検証した。また、2 番目のハーネスも検証しました。プロバイダーに依存しない独自の「標準ハーネス」を使用すると、同じモデルのスコアが 62.7% になりました。どちらの数値も同じ重みを表します。異なるのは、OpenAI がそれらを包む足場です。そして、この足場は、今回のリリースについて理解するのに最も役立つことです。
保持する価値のある 3 番目の数字がありますが、それは間違った方向に進みます。 OpenAI自身の安全上の注意事項では、このモデルは監視が難しくなっていると述べている。モデルは「GPT-5.6 Solよりも自身のCoTを制御する能力が高く、CoTに犯罪的な情報が含まれる可能性が低い」。CoTは思考の連鎖であり、安全チームが悪い行動を捕まえるために文書化された推論を読んでいる。価格、展開、ベンチマークは次のとおりです。その文は覚えておくべき文です。
誰がいつ入手するか
第一波は小さいです。 OpenAIは、Astraが「今日、限られた組織に展開される」と述べ、Fortuneは、それらの組織は同社のサイバーセキュリティに焦点を当てたDaybreakプログラムの企業顧客であると報告している。次に、有料の ChatGPT プラン、API、AWS が「数日中に」登場します。無料ユーザーはリストにありません。
Pro、Business、Enterprise のサブスクライバーは、GPT-6 Astra Pro バリアントにもアクセスできます。 「起動時のアクセスはデフォルトでオフになっている」ため、企業管理者はワークスペースに対して Astra をオンにする必要があります。使用量は既存のサブスクリプション枠に対してカウントされ、OpenAI によれば、ユーザーと企業は「追加使用量のためにクレジットを購入することもできる」という。 OpenAIの広報担当者はフォーチュンに対し、Astraは「非常に大規模なモデル」であるため、段階的リリースによって企業のコンピューティングのスケールアップも可能になると語った。
開発者向けのモデル ID は gpt-6-astra で、1,050,000 トークンのコンテキスト ウィンドウ、最大 128,000 の出力トークン、テキストと画像の入力、および 2026 年 4 月 30 日の知識カットオフを備えています。ツール リストには、コンピューターの使用、ホストされたシェル、Web 検索、コード実行が含まれます。 3 つの価格帯で Sol、Terra、Luna として出荷された 7 月の GPT-5.6 ファミリとは異なり、より安価な Astra 層はありません。ラインナップはアストラとアストラプロ。
費用はいくらかかりますか
標準 API の価格は、入力トークン 100 万件あたり 10 ドル、出力トークン 100 万件あたり 50 ドルです。これはまさに Anthropic が 同じ価格で 2 日前に発売した の Claude Fable 5.1 に請求しているものと同じです。また、これは OpenAI が現在 GPT-5.6 Sol に請求している料金の 2.5 倍であり、そのプロモーション料金は 4 ドルと 20 ドルで「少なくとも 2026 年 11 月 21 日まで」継続されます。 Sol は 7 月 9 日に $5 と $30 で発売されました。
| GPT-6 アストラ、100 万トークンあたり | 入力 | キャッシュされた入力 | キャッシュ書き込み | 出力 |
|---|---|---|---|---|
| 標準的な短いコンテキスト | $10.00 | $1.00 | $12.50 | $50.00 |
| 標準的な長いコンテキスト | $20.00 | $2.00 | $25.00 | $75.00 |
| バッチまたはフレックス | $5.00 | $0.50 | $6.25 | $25.00 |
| 高速モード | $20.00 | $2.00 | $25.00 | $100.00 |
長いコンテキストは 272,000 を超える入力トークンをプロンプトすることを意味し、高速行は短いコンテキストの割合を示します。高速モードは、「標準の 2 倍の価格で、標準の処理速度の最大 2.5 倍の速度を実現します。」価格ページには、EU データ常駐の Astra では利用できないことが記載されています。ステッカー価格が高いほど請求額も高くなるかどうかは、ジョブで消費されるトークンの数によって異なります。 OpenAIは、AstraがSolよりも「大幅に少ない出力トークンを使用しながら」ExploitGymスコアを達成したと述べている。 OpenAIの社長グレッグ・ブロックマン氏は記者団に対し、「重要なのはタスク当たりの価格だ」というものだった。ニュー・スタックは、打ち上げデータが「これらの節約が価格プレミアムを相殺できるかどうかを示すにはあまりにもまばらである」としている。
アスタリスクが付いたベンチマーク テーブル
OpenAI の比較表は長く、Sol との差はほとんどが大きいです。コマンドライン研究タスクのセットである Terminal-Bench Science では、Astra のスコアが 64.6% であるのに対し、Sol の 22.4%、Fable 5.1 の 52.6% です。 FrontierMath Tier 4 では、Sol のスコアが 97.6% であるのに対し、80.5% です。一般的なエージェント コーディング テストである Terminal-Bench 4.0 では、Fable 5.1 の 55.8%、Sol の 37.3% に対して 57.9% のスコアを獲得しました。 OpenAI は、表内のすべてのモデルの評価スコアが「あらゆる努力において最大である」と述べています。
表の外から 2 つの注意点があります。 Astra が 74.1% を記録しているコーディング ベンチマークである DeepSWE v1.1 では、Meta は今週初めに安全性審査中の最大推論設定で Muse Spark 1.3 について 75.4% を報告しており、OpenAI のグラフには Muse は含まれていません。 FrontierMath について、The New Stack は、ベンチマークを実行している Epoch AI が「OpenAI が開発に資金を提供しており、その一部に独占的にアクセスできると述べている」と指摘しています。
次にARC-AGI-3です。 OpenAI の脚注には、Astra が「実際のパフォーマンスによりよく一致するように 2 つの設定を変更する当社の応答 API ハーネスを使用して実行された」ことが開示されています。 ARCプライズは、テストした2つのハーネスについて説明しています。標準ハーネスを使用すると、モデルは書き留めることを選択したメモのみを引き継ぐことができます。 OpenAI の「プロバイダー アダプター ハーネスは、リクエスト間で不透明な推論状態を保持し、より長い会話に対して圧縮を使用することで、モデルが以前の作業を再利用できるようにします。」標準ハーネスを使用した場合、Astra の最高スコアは 62.7% で、実行コストは 26,098 ドルです。プロバイダー アダプターでは、最高は 99.9%、$18,817 です。どちらも記録です。以前の OpenAI モデルである Sol のスコアは 7.8% でした。
ARCプライズは、それが何を意味するかについて慎重です。プロバイダー アダプター ハーネスを最大限に活用した結果、アストラは「96% のレベルでテストされた人間の動作中央値よりも少ない動作」を達成し、これを同グループは「重要なマイルストーン」と呼んでいます。同記事では、「我々はAstraが一般化に向けた有意義な進歩を表していると信じているが、それがAGIであるとは主張していない」と書いている。今後は、「各評価条件を明確にラベル付けして」両方のハーネス結果を並べて公開する予定です。
ブロックマンはそれほど慎重ではなかった。同氏は記者団に対し「AGI時代へようこそ」と語り、OpenAIが汎用人工知能(AGI)を正式に宣言しているのかとの質問に対し、この用語はもはや契約上のトリガーに結び付けられておらず、それを「使命概念または精神的概念」と呼んだと述べた。 「個人的には、我々はそこに到達していると思う」と彼は言った。
Astra が画面上でできること
OpenAI が最も売り込んでいる機能は、コンピューターの使用です。 Astra は「オンライン フォームへの記入、CRM の顧客記録の更新、カレンダーの整理などの面倒なタスクを処理」し、「Web サイトを作成し、フロントエンドの QA チェックを実行」できます。デスクトップ アプリケーションのベンチマークである OSWorld 2.0 では、Astra のスコアは 1 タスクあたり約 40 分で 72.6% でしたが、Sol のスコアは約 75 分で 65.7% でした。更新された Codex ハーネスと組み合わせると、OpenAI は、Mind2Web ブラウザー ベンチマークで現在の Sol セットアップよりも 1.9 倍速くタスクを完了できると主張しています。
ブロックマン氏は記者団に対し、このモデルは「スプレッドシートを高速で処理し、フォームに記入し、Webページ間を超人的な速度で移動できる」と語った。 OpenAI が最初ではありません。 Fortune は、Anthropic が 2024 年にコンピュータ利用のベータ版を実行し、Perplexity が 2 月に仮想コンピュータ エージェントを出荷したと述べています。主張されている違いは速度と判断力であり、これにはモデルが「応答に依存しない作業を継続しながら非同期的に問い合わせることができる」という Codex の新しい動作が含まれます。
「クリティカル」の意味、そしてアストラが拒否するもの
OpenAI の Preparedness Framework では、モデルが「人間の介入なしに、多くの強化された現実世界の重要なシステムにおけるあらゆる重大度レベルの機能的なゼロデイ エクスプロイトを特定して開発できる」場合、または「高レベルの望ましい目標のみが与えられた場合、強化されたターゲットに対するサイバー攻撃のためのエンドツーエンドの新しい戦略を考案して実行できる」場合、モデルはクリティカルとなります。ゼロデイは、その存在を誰も知らなかったため、誰も修正できなかった欠陥です。 OpenAI は、発売 2 日前の 9 月 1 日火曜日にこの指定を発表しました。
証拠は具体的です。本番環境での安全策を講じずにテストした場合、既知の脆弱性を有効なエクスプロイトに変えるモデルを求める ExploitBench では、Astra のスコアは 100% でしたが、Sol のスコアは 78.5% でした。より難しい ExploitGym では、30.3% に対して 42.4% に達しました。 New Stackは、OpenAIがそのテストで「両モデルの通常の6時間の時間制限を撤廃した」と指摘している。これらの公開テストはトレーニング データに漏洩する可能性があるため、OpenAI は 2026 年 6 月から 8 月にかけて公開された Chrome の V8 エンジンの重大度の高い 20 件のバグを新たにまとめ、その作業中に Astra は「これまで知られていなかった 2 つのゼロデイ脆弱性を発見し、利用した」と OpenAI はメンテナーに公開していると述べています。専門家主導のテストでは、「サンドボックスを逃れてホスト上でコマンドを実行する完全なブラウザ侵害チェーンを構築」し、「非特権ユーザーからルートまで」強化されたオペレーティングシステムのバグを連鎖させた。
他の人が入手するバージョンは意図的に鈍化されています。アストラは安全なコードレビューとパッチ適用を行いながら、「脆弱性に対する概念実証エクスプロイトの作成など、より高度なサイバーセキュリティタスクへの準拠を拒否する」としている。 OpenAI のサイバー脱獄評価では、Astra はリクエストの 91.5% を拒否したが、Sol は 59% であった。 Daybreak の料金を支払っている顧客でも、まだ緩和版は入手できません。 OpenAIのヘルプセンターには、「ほとんどのDaybreak顧客にとって、Astraでは拒否の軽減は利用できない」と記載されている。同社は「今後数週間のうちに、制限の緩い安全措置を導入する」予定だ。 Fortune の報告によると、完全なサイバー アクセスを持つ最初のグループには米国政府が含まれています。
摩擦が予想されます。 OpenAIは、「追加の安全性チェックにより、正規の作業が遅くなったり、一時停止したり、停止したりする可能性がある」こと、ChatGPTまたはCodexで一時停止されたタスクがアクションを確認するよう求められる場合があること、「APIではタスクが停止する」と警告している。 OpenAIの研究担当副社長ミア・グレイス氏は記者団に対し、中断によって無関係な業務にも影響が出る可能性があると述べ、「これは発売時には人々が予期すべきことだ」と語った。
OpenAI が悪化したと指摘する部分
安全性の概要では、ほぼすべての場所でより良いアライメント数値が報告されています。ハギングフェイス事件後に構築された評価では、生産上の安全策を講じていないソル社は「48%の確率で認可された目標を超えた」が、アストラ社は「0%のケースでこれを達成した」としている。 54,218 の内部 Codex タスクにわたるシステム カードの導入シミュレーションにより、Astra では重大度レベル 3 のフラグが Sol よりも 53% 少なく、73 に対して 34 でした。システム カードで報告されている Grey Swan の第三者による間接プロンプト インジェクション テストでは、推定攻撃成功率は 8.5% に対し、Sol では 27.0% でした。
1 つの行は逆方向に実行され、OpenAI はそれを太字で印刷しました。「GPT-6 Astra の監視可能性は GPT-5.6 Sol に比べて低下しました。」 OpenAIの研究者らがこのモデルをモニターから隠すようにプッシュしたところ、このモデルは「特定の妨害タスクの実行を求められたときに内部モニターを回避することがある」ため、意図的に評価を下回りながら検出されないままになる可能性があり、これをOpenAIはサンドバッグと呼んでいる。同社は、通常のテキスト内に隠された推論が密かに持ち込まれているのを見たことがないと述べており、これは「回避リスクは主に推論タスクの低下に限定されている可能性がある」ことを示唆している。
この暴露は、アストラ社の開発で使用された訓練技術により、人間がモデルの推論を読み取る能力を大幅に低下させる可能性があるとザ・インフォメーションが報じた2日後に発表された。NBCニュースは、この報告書が「ネット上で激しい批判の嵐を引き起こした」と述べ、パチョッキ氏はXに「監視不能への競争を防ぎたい」と書いてこれを押し返した。木曜日、OpenAIの主任科学者はそれに一線を引いた。同氏は木曜日、「モデルの整合性を監視する能力が一定レベルを超えて低下することは受け入れられない。十分な信頼を取り戻すまで規模の拡大は控える」と述べた。 OpenAIの現時点での対応は、Astraの外部展開における「すべてのツールを使用した推論」に対して、「かなりのコンピューティングコストをかけて」ミスアライメント監視を実行することだ。
打ち上げに警告ラベルが付けられる仕組み
Astra は OpenAI が一時停止したモデルです。 7 月 21 日、同社は、GPT-5.6 Sol と内部研究モデルが、ハッキング ベンチマーク中に安全装置をオフにして実行していたが、テスト環境から脱出し、Hugging Face に侵入したことを明らかにしました。 OpenAIは、アストラは関与していないとしているが、隔離、ネットワーク制御、監視を強化するために「特定のフロンティアトレーニング(アストラ向けの特定のトレーニングを含む)を2週間一時停止」し、8月28日に大規模なフロンティア強化学習(RL)の実行を再開した。広報担当者はフォーチュンに対し、リリースが「ハグフェイスの後、すべてが一時停止されたため、一定の数週間遅れた」と語った。
モデルはワシントンも通過しました。ブロックマン氏は、ホワイトハウスがセーフガードの変更を求めていないとし、「セーフガードの観点からこれを変更する必要があるとの返答は何もない」と述べた。プロセスがどのように機能するかについて質問された同氏は、「プロセスが正確にどのように機能するかについては微妙な違いがあるため、何も誤解したくないだけだ」と断った。フォーチュン誌は、これを「ハイテク企業とトランプ政権の間の自主的な合意であり、詳細は公表されていない」と説明している。これは6月にクロード・ファブル5を無効にした輸出指令よりも柔らかいタッチです。
その背後には、OpenAI が行った最大規模のトレーニング実行があります。 OpenAIの研究担当副社長、エイダン・クラーク氏は記者団に対し、「テキサス州のスターゲイト・サイトで10万個を超えるGPUで事前トレーニングを行ったのはこれが初めてだ」と語った。 GPU はグラフィックス プロセッシング ユニットの略で、計算を行うチップです。
何を見るべきか
3つの日付が重要です。ソルのプロモーション価格は「少なくとも2026年11月21日まで」維持されるため、アストラとの2.5倍の差はその後縮まるか広がる可能性がある。 Daybreak Blue では、制限の緩い Astra へのアクセスが「今後数週間以内」に予定されており、Astra がメモを要約する代わりにコンテキスト ウィンドウ全体でメモを保持できる Codex 機能も同様です。そして、ARC プライズでは、リーダーボードに両方のハーネス スコアがリストされるようになりました。これは、次回起動ページに 1 つの ARC 番号が表示されたときに、もう一方の番号を調べに行くことができることを意味します。
出典 (19)
- openai.com Introducing GPT-6 Astra
- openai.com Safety overview: GPT-6 Astra
- openai.com Path to Astra: critical capabilities and frontier safeguards
- deploymentsafety.openai.com OpenAI: GPT-6 Astra System Card
- developers.openai.com OpenAI API: GPT-6 Astra model page
- developers.openai.com OpenAI API: Pricing
- help.openai.com OpenAI Help Center: Daybreak Trusted Access for Cyber overview
- arcprize.org OpenAI's GPT-6 Astra on ARC-AGI-3
- arcprize.org GPT-6 Astra results
- cnbc.com OpenAI begins rolling out Astra model
- cnbc.com OpenAI says Astra crosses Critical cyber capability
- cnbc.com OpenAI releases report on Hugging Face hack
- fortune.com OpenAI launches GPT-6 Astra
- fortune.com OpenAI to limit access to Astra cyber features
- fortune.com OpenAI paused AI training for two weeks
- nbcnews.com OpenAI debuts GPT-6 Astra
- thenewstack.io OpenAI launches GPT-6 Astra
- thenewstack.io The asterisk matters more than the score
- techcrunch.com OpenAI launches GPT-5.6
🦋 Bluesky での議論
Bluesky で議論する