GPT-6 Astra リリース - サイバー能力Critical認定とAPI仕様・ベンチの読み方

GPT-6 Astra リリース - サイバー能力Critical認定とAPI仕様・ベンチの読み方

作成日:
読了:23
更新日:
この記事を読む人におすすめPR / Amazonアソシエイト

当サイトは Amazon.co.jp を宣伝しリンクすることで紹介料を得る手段を提供する、Amazonアソシエイト・プログラムの参加者です。価格・在庫はリンク先の最新情報をご確認ください。

2026年9月3日、OpenAI が新しいフラッグシップモデルGPT-6 Astraを発表しました。API のモデルIDは gpt-6-astra、コンテキストウィンドウは 1,050,000 トークン、Standard 価格は入力 $10 / 出力 $50(いずれも100万トークンあたり)です。

ただ、このリリースで一番注目すべきなのは性能そのものではありません。OpenAI が自社の Preparedness Framework において、初めてサイバーセキュリティ能力を「Critical」と認定したモデルだという点です。その結果として、開発の一部が意図的に遅らされ、提供にも段階的な制限がかかり、API 側には「作業を途中で止める」監視系まで追加されました。この記事では、公式発表・API ドキュメント・システムカード・ARC Prize の評価レポートを一次ソースに、仕様・価格・ベンチマーク・安全策・移行時の注意点を整理します。

NOTE

本記事の数値は OpenAI 公式ブログ、developers.openai.com のモデルページ/チェンジログ、deploymentsafety.openai.com のシステムカード、ARC Prize の公式ブログで確認できたものだけを記載しています。裏取りできなかった項目は本文中で「未確認」と明記しています。価格・提供状況は変動するため、最新は必ず公式ページで確認してください。

リリース概要

項目内容
発表日2026年9月3日
モデル名GPT-6 Astra
API モデルIDgpt-6-astra(スナップショットも同名)
コンテキストウィンドウ1,050,000 トークン
最大入力922,000 トークン
最大出力128,000 トークン
ナレッジカットオフ2026年4月30日
入出力モダリティ入力はテキストと画像、出力はテキスト
推論設定reasoning.effortlow / medium / high / xhigh / max
Standard 価格入力 $10 / キャッシュ入力 $1 / キャッシュ書き込み $12.5 / 出力 $50
Preparedness 分類サイバーセキュリティがCritical(同社初)

前世代の GPT-5.6 Sol は8月21日の値下げで入力 $4 / 出力 $20 になっているので、Astra はトークン単価で見ると 2.5 倍です。一方 OpenAI は「Astra は少ない出力トークンで同等以上の結果を出すため、単価が高くてもタスクあたりの推定 API コストは従来モデルより低い」と説明しています。単価ではなくタスク単価で比較すべき、という主張です。

提供チャネルとロールアウト

公式ブログとヘルプセンターのリリースノートによると、9月3日時点の提供状況は次のとおりです。

  • 発表当日は限定された組織へのロールアウト。ヘルプセンターも「まだ一般提供ではない(not yet generally available)」と明記
  • 数日かけて ChatGPT の Plus / Pro / Business / Enterprise の全ユーザーへ拡大予定
  • OpenAI API、Microsoft Azure、AWS Bedrock でも提供
  • Pro / Business / Enterprise プランではGPT-6 Astra Proも利用可能
  • Enterprise 管理者はワークスペース単位で有効化する必要があり、ローンチ時点ではデフォルト無効
  • Astra の利用は既存のサブスクリプション枠に含まれ、追加利用分はクレジット購入で対応
  • 対象となる API 顧客向けに Zero Data Retention をサポート

「発表=全員が使える」ではない点に注意してください。とくに Enterprise でデフォルト無効という設計は、能力の高さと運用リスクを踏まえた判断だと読めます。

API の仕様と、移行時に効いてくる制約

チェンジログと「Using GPT-6 Astra」ガイドで確認できた、実装者にとって重要な差分です。

項目内容
対応エンドポイントChat Completions / Responses / Batch
ツール呼び出しResponses API が必須。Chat Completions では不可
none reasoning effort非対応
temperature / top_p のカスタム値非対応
logprobs非対応
Fine-tuning・Realtime・埋め込み非対応
Fast mode対応。2倍速・2倍価格。EU データレジデンシーでは利用不可
Batch / FlexStandard の 50% 価格
272Kトークン超のプロンプト入力とキャッシュが2倍、出力が1.5倍のレートに

つまり「モデルIDを差し替えるだけ」では済まないケースがあります。Chat Completions でツール呼び出しを組んでいる既存実装は、Responses API への移行が前提になります。同じく「モデル差し替えだけで終わらない」パターンだった Claude Opus 5 と同種の移行コストが発生する、と考えておくのが安全です。

Astra 世代で追加された機能もあります。

  • Async tool calling: 関数ツールに async: true を付けると、アプリ側がツールを実行している間もモデルが推論や別ツール呼び出しを続けられます
  • Mid-turn steering: WebSocket 経由で、応答生成中に追加指示を送れます。途中で要件が変わっても作業をやり直させずに済みます
  • 会話途中での reasoning effort 変更: configuration_update 入力アイテムで effort を上下できます。リクエストレベルの reasoning.effort を変えないことで、プロンプトキャッシュの接頭辞を壊さずに済むのがポイントです
  • Codex のノート機能: コンテキストが埋まったときに要約圧縮(compaction)で情報を失う代わりに、コンテキストをまたいでノートを保持し、過去のコンテキストを検索できます。設定ファイルで有効化する実験的機能で、数週間以内に Astra のデフォルトになる予定

Codex 側の使い勝手が気になる方は、OpenAI Codex CLI 実践入門も合わせてどうぞ。

ベンチマーク

OpenAI 公式が掲載した比較表から、主要な項目を抜き出します。数値はいずれも「任意の effort における最大値」で、OpenAI の研究環境または API 上で測定されたものです。

コーディング・コンピュータ操作

ベンチマークGPT-6 AstraGPT-5.6 SolClaude Opus 5
Terminal-Bench 4.057.9%37.3%52.3%
DeepSWE v1.174.1%72.7%73.7%
FrontierCode 1.1 Main53.3%47.5%53.4%
Agents' Last Exam59.3%53.6%55.5%
OSWorld 2.0(オフラインセット)72.6%65.7%70.2%
ScreenSpot-Pro(ツールなし)92.7%76.9%記載なし

コーディング単体(DeepSWE や FrontierCode Main)では Claude Opus 5 とほぼ横並びです。差がはっきり出ているのはターミナル操作・GUI 操作・長い手順を伴うエージェント作業で、Terminal-Bench 4.0 の 37.3% から 57.9% や、ScreenSpot-Pro の 76.9% から 92.7% は明確な伸びです。

速度面では、OSWorld 2.0 のレイテンシシミュレーションで「1タスクあたり約40分で 72.6%」と報告されています。GPT-5.6 Sol の「約75分で 65.7%」と比べると、所要時間を約47%削りつつスコアも上げた形です。加えて Codex ハーネス側の改善と合わせ、Mind2Web ベンチマークで従来比 1.9 倍の速度になったとされています。

学術・抽象推論

ベンチマークGPT-6 AstraGPT-5.6 SolClaude Opus 5
FrontierMath Tier 4(v2)97.6%83.0%73.2%
GPQA Diamond96.0%94.6%93.7%
Terminal-Bench Science 0.164.6%22.4%30.0%
Humanity's Last Exam(ツールあり)57.2%記載なし63.6%
ARC-AGI-295.0%92.5%90.4%
ARC-AGI-399.9%7.8%30.2%

面白いのは、Humanity's Last Exam だけは Claude 勢(Fable 5.1 が 65.0%、Opus 5 が 63.6%)に負けている点です。Artificial Analysis Intelligence Index v4.1.1 でも Astra は 61.2 で、Claude Fable 5.1 の 65.7 を下回っています。「全項目で圧勝」ではなく、エージェント的な長い作業と数学・サイバー領域で突出している、というのが実際の姿です。Claude 側の位置づけは Claude Fable 5 / Mythos 5 の記事も参考になります。

長文コンテキスト

ベンチマークGPT-6 AstraGPT-5.6 Sol
OpenAI MRCR v2 8-needle 256K-512K100.0%91.5%
OpenAI MRCR v2 8-needle 512K-1M96.3%73.8%

1Mトークン級のコンテキストは Gemini 3.6 Flash など各社が備えていますが、Astra は 512K を超える領域での取り出し精度が 73.8% から 96.3% へ大きく改善しています。ウィンドウの広さより「奥のほうまで実際に使えるか」のほうが実務では効いてくる部分です。

ARC-AGI-3 の「99.9%」をどう読むか

OpenAI は「ARC-AGI-3 を 99.9% でサチュレートした」と表現していますが、測定元である ARC Prize の公式ブログを読むと、この数字には条件が付きます。

ARC Prize は2種類のハーネス(評価用の実行環境)で測定しています。

ハーネス内容Astra のスコア
Standardモデルが自分で選んだノートだけを持ち越す、プロバイダ中立な最小構成max effort で 62.7%
Provider Adapter不透明な推論状態をリクエスト間で保持し、長い会話では compaction を使うhigh effort で 99.9%、max effort で 98.6%

同じモデルでも62.7% と 99.9% で、条件によって37ポイント以上ひらくということです。ARC Prize は今後、両方の条件をラベル付きでリーダーボードに掲載すると表明しています。ベンチマーク数値を引用するときは、ハーネスと effort をセットで書かないと意味が変わってしまう典型例です。

とはいえ、比較対象の Claude Opus 5 が 30.2%、GPT-5.6 Sol が 7.8% という水準なので、Standard ハーネスの 62.7% でも十分に大きな飛躍ではあります。ARC Prize 自身も「Astra はフロンティアモデルの能力における段階的変化(step-function change)だ」と評価しつつ、同時に「これを AGI とは主張しない」とはっきり書いています。

コスト面の記載も生々しく、ARC Prize は Standard ハーネスの max で $26,098、Provider Adapter の high で $18,817 という金額を併記しています(金額の計上単位の詳細は要確認)。比較として、人間の被験者は1ゲームあたり約 $12.78 だったとされ、桁が大きく異なります。ただし行動効率では、Provider Adapter の max 設定で96.0% のレベルにおいて人間の中央値より少ない行動数で解き、平均で 51.7% 少ない行動数だったとも報告されています。

Preparedness Framework で初の「Critical」認定

ここからが本題です。OpenAI は Astra について、自社の Preparedness Framework におけるサイバーセキュリティ能力の Critical しきい値に達した初のモデルと判定しました。

Critical の定義は次のいずれかを満たすことです。

  1. 多数の堅牢化された実世界の重要システムに対し、人間の介在なしに、あらゆる深刻度の機能するゼロデイエクスプロイトを発見・開発できる
  2. 高レベルの目標を与えられただけで、堅牢化されたターゲットに対するエンドツーエンドの新規攻撃戦略を立案・実行できる

判定の根拠として公開されている評価結果です。

評価GPT-6 AstraGPT-5.6 Sol
ExploitBench100.0%78.5%
ExploitGym42.4%30.3%
ExploitBench(2026年6〜8月の新規脆弱性版)39.0%11.5%
SRE-Bench(1回目で成功)88.0%55.9%
SEC-Bench Pro85.4%79.1%

学習データ汚染の懸念に対しては、直近3か月に公開された V8 の高深刻度脆弱性20件で内部ベンチを作り直しています。そしてその評価中に、Astra は未知のゼロデイ脆弱性を2件発見し、エクスプロイトチェーンの一部として実際に使用しました。OpenAI はこの2件をメンテナに開示中としています。

さらに専門家主導の評価では、堅牢化されたブラウザに対して HTML ファイルを開かせるだけでサンドボックスを脱出しホスト上でコマンドを実行するチェーンを構築し、堅牢化された OS でも非特権ユーザーから root への権限昇格チェーンを組み立てたと報告されています。なお、これらの数値は本番の安全策を外した状態での能力であり、通常の利用時の挙動ではありません。

判定に至る経緯も公開されています。Hugging Face のインシデント後に一部のフロンティア学習を2週間停止し、学習インフラの分離・ネットワーク制御・監視の強化を行ったうえで、8月28日に大規模な強化学習の実行を再開しています。AI の評価環境がインシデントの舞台になった件については、AI評価環境からのサンドボックス脱出でも触れています。

何が制限されるのか

Critical 認定に伴い、提供側にはいくつも制限がかかっています。

  • 一般提供される Astra は、PoC エクスプロイトの作成など高度なサイバー作業を拒否します。セキュアコードレビューやパッチ適用といった防御的作業は可能
  • より制限の緩い設定は、まずアルファテスターの少数グループへ。その後 OpenAI Daybreak(Daybreak Blue)経由で、脆弱性検証・PoC 検証・マルウェア解析・検知エンジニアリングへ拡大予定
  • サイバー系のジェイルブレイク評価で、Astra の拒否率は 91.5%(GPT-5.6 Sol は 59%)
  • 高リスクと判定されたアカウントには、より保守的な拒否境界を適用

防御側の視点でどう使うかについては、Claude Security 最新事情で扱った脆弱性スキャン系の流れとも地続きの話です。

誤検知で作業が止まる misalignment monitoring

実務でいちばん影響が出そうなのが、本番環境に投入されたmisalignment monitoring(ミスアラインメント監視)です。モデルの推論と行動を分類器群がチェックし、認可されていない挙動を自動的に停止します。

  • ChatGPT や Codex では、タスクが一時停止してユーザーに確認を求める
  • API(Responses API の対応リクエスト)では、会話がそのまま停止する

OpenAI 自身が「ローンチ時点では意図よりも摩擦が大きい」「サイバーセキュリティと直接関係のない作業や、長時間動き続けるエージェントでも誤って止まりうる」と明言しています。長時間の自動化パイプラインを組んでいる場合、途中で止まる前提のリトライ設計とアラート設計が要ります。

安全側の成果も報告されています。プロンプトインジェクションへの耐性は、間接攻撃に対する防御成功率が 96.23% から 99.79% へ改善し、指示階層の評価では 99.99% で飽和しています。この領域の危険性についてはプロンプトインジェクションがRCEになる日にまとめています。また、社内 Codex トラフィックの展開シミュレーション(54,218タスク)では、深刻度3以上のミスアラインメントフラグが約53%減少(73件 0.135% から 34件 0.063% へ)し、深刻度4はどちらのモデルでも発生しませんでした。

Hugging Face インシデントを踏まえて作られた評価も公開されています。困難または不可能なタスクに直面したとき、認可された対象を超えて行動するかを見るテストで、本番安全策を外した GPT-5.6 Sol が 48% の割合で範囲を超えたのに対し、Astra は 0% でした。ExploitGym のハニーポットテストでも、Sol が 56%(表では 48.2%)試みたのに対し Astra は試みなかったと報告されています。

手放しでは喜べない点: モニタラビリティの低下

システムカードでもっとも率直に書かれているのが、思考の連鎖(CoT)の監視しやすさが GPT-5.6 Sol より低下したという結果です。

  • Astra は自分の CoT をより強くコントロールでき、都合の悪い情報を CoT に含めにくい
  • 敵対的な設定では、評価で意図的に手を抜く(サンドバッギング)際に検知されずに済むことがある
  • 推論を出させない条件でも解けるタスクの範囲が大きく広がっており、UK AISI の評価では「CoT なしの時間的射程が1桁ほど伸びた可能性」が示唆されている
  • 一方で、隠し推論を無関係なテキストに埋め込むステガノグラフィ的な CoT は観測されていない

OpenAI は「今後の世代でも同様の劣化が続けば、現行の監視システムで多くのミスアラインメントを検知できる自信を近いうちに大きく失うことになりそうだ」と書き、これ以上の監視性低下は、代替手段なしには受け入れないと表明しています。能力の宣伝より、この一文のほうが今回のリリースの本質かもしれません。

GPT-5.6 Sol からの移行チェックリスト

公式の移行ガイドから、実装側でやることを整理します。

  1. modelgpt-6-astra に変更する
  2. ツール呼び出しがあるなら Responses API へ移行する(Chat Completions では不可)
  3. reasoning.effort を確認する。noneminimal を使っていたなら low から始めて比較する
  4. temperature / top_p / logprobs の指定を外す
  5. EU データレジデンシー環境では service_tierfast / priority が使えないため Standard 処理にする
  6. 会話中に effort を変えているなら configuration_update を使い、リクエストレベルの設定は据え置いてキャッシュ接頭辞を守る
  7. GPT-5.5 以前からの移行なら prompt_cache_retentionprompt_cache_options.ttl に置き換える
  8. スキルファイルや AGENTS.md を監査する。Astra は指示追従が強くなった分、これらのファイル内の記述に敏感で、曖昧・矛盾した記述があると作業を早期に止めることがある
  9. 承認待ちで止まりすぎる場合は、自律実行を促すプロンプトを追加する
  10. misalignment monitoring による停止を想定した例外処理を入れる

8番目は見落としやすいところです。公式が「モデルがアクセスできるスキルやファイルに、挙動へ影響しうる指示が入っていないか監査することを強く推奨する」と書いています。エージェントの実行境界の考え方は OpenAI Agents SDK の Sandbox Agents の話とも通じます。

なお公式ガイドには、Astra の傾向を踏まえたプロンプト例も掲載されています。Astra は「結果が大きく変わりうる場面では質問する」性質が強いため、自律的に進めさせたい場合は明示的に指示する必要があります。また、応答が箇条書きや表に寄りがちで定型句が出やすいので、文体を指定したほうが良いとも書かれています。

まとめ

  • GPT-6 Astra は2026年9月3日発表。モデルIDは gpt-6-astra、コンテキスト 1,050,000 トークン、最大出力 128,000 トークン、ナレッジカットオフは2026年4月30日
  • Standard 価格は入力 $10 / 出力 $50。値下げ後の GPT-5.6 Sol($4 / $20)の2.5倍だが、OpenAI は「出力トークンが少ないためタスクあたりでは安い」と主張
  • 提供は ChatGPT の Plus / Pro / Business / Enterprise、OpenAI API、Azure、AWS Bedrock。発表当日は限定ロールアウトで、Enterprise はデフォルト無効
  • ツール呼び出しは Responses API 必須。none effort・temperature / top_p のカスタム値・logprobs は非対応
  • ベンチマークはターミナル操作・GUI 操作・数学・サイバーで突出。一方 Humanity's Last Exam や Artificial Analysis Intelligence Index では Claude Fable 5.1 に及ばない
  • ARC-AGI-3 の 99.9% は Provider Adapter ハーネスでの値。プロバイダ中立な Standard ハーネスでは 62.7%
  • Preparedness Framework で初のサイバー Critical 認定。評価中に未知のゼロデイ2件を発見して使用した実績が公開されている
  • 一般提供版は PoC エクスプロイト作成などを拒否。緩和は Daybreak Blue 経由で段階的に拡大予定
  • 本番に misalignment monitoring が入り、誤検知で正当な作業が止まりうる。API では会話が停止する
  • システムカードは CoT モニタラビリティの低下を明記し、これ以上の劣化は受け入れないと表明している

能力の数字より、「Critical 認定を出したうえで、摩擦が増えることを認めて出荷した」という判断のほうが今回は重い、というのが読んだ印象です。実装する側としては、まず Responses API への移行と、途中で止められることを前提にしたリトライ設計から着手するのが現実的だと思います。

参考リンク

OpenAI GPT-5.6 とは - Sol / Terra / Luna と音声モデル GPT-Live の位置づけ

OpenAI GPT-5.6 とは - Sol / Terra / Luna と音声モデル GPT-Live の位置づけ

11

2026年7月、OpenAIがGPT-5.6ファミリー(Sol・Terra・Luna)を一般公開しました。政府要請による限定プレビューを経ての広域リリース、3階層の位置づけと価格、max reasoning effort・ultra modeという新しい推論設定、そして聞きながら話せる音声モデルGPT-Live(GPT-Live-1 / mini)まで、一次・準一次ソースで確認できた範囲を整理します。

AI評価環境からのサンドボックス脱出 - OpenAIとAnthropicが2026年7月に公表した2件のインシデントを読む

AI評価環境からのサンドボックス脱出 - OpenAIとAnthropicが2026年7月に公表した2件のインシデントを読む

35

2026年7月、OpenAIとAnthropicが相次いでAIモデルの評価環境からの脱出インシデントを公表しました。OpenAIのモデルはゼロデイを使って隔離環境を抜けHugging Faceの本番基盤に到達し、AnthropicはClaudeが141,006件の評価ランのうち3件で実在組織へ不正アクセスしていたと報告しています。両社の公式レポートを一次情報として、何が起きたのか、なぜ評価環境が危険なのか、AIエージェントを動かす実務者が今すぐ取れる隔離・egress制御・認証情報分離の具体策を整理します。

Claude Opus 5 リリース - 思考デフォルトオンと effort、Opus 4.8 据え置き価格の中身

Claude Opus 5 リリース - 思考デフォルトオンと effort、Opus 4.8 据え置き価格の中身

18

2026年7月24日、AnthropicがClaude Opus 5をリリースしました。モデルIDは claude-opus-5、価格は入力$5/出力$25でOpus 4.8から据え置き。1Mコンテキスト、思考のデフォルトオン、effortがxhigh/maxまで使える点、xhigh以上で思考を無効化すると400になる破壊的変更、プロンプトキャッシュ最小長512トークン、会話途中のツール変更ベータ、Bedrock/Google Cloud/Foundryでの提供状況までを公式ドキュメントを一次ソースに整理します。