Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

作成日:
読了:約12分
更新日:
この記事を読む人におすすめPR / Amazonアソシエイト

当サイトは Amazon.co.jp を宣伝しリンクすることで紹介料を得る手段を提供する、Amazonアソシエイト・プログラムの参加者です。価格・在庫はリンク先の最新情報をご確認ください。

Google が米国時間2026年9月30日(日本時間10月1日)、新しいフロンティアモデル Gemini 4 Argon を発表しました。Gemini 4 世代の最初のモデルで、7月の Gemini 3.6 Flash の発表の時点では「事前学習を開始した」と予告されていたものです。

ただし、発表時点では誰でも使えるわけではありません。最初に提供されるのは、Google の Fairwind Program に参加するサイバー防御の組織だけです。この記事では、Google 公式ブログの発表文を一次情報として、何ができるモデルなのか、なぜ段階的に公開されるのかを整理します。

発表の全体像

項目内容
発表2026年9月30日(米国時間)
位置づけGoogle の新しいフロンティアモデル。長く複雑な業務フローで深い推論を維持することを狙う
得意分野実務のソフトウェア開発、法務・財務などの知的業務、サイバー防御
出力トークン上限1M トークン(従来の64Kから拡大)
導入価格入力 $2 / 100万トークン、出力 $10 / 100万トークン。キャッシュ済み入力は入力価格の95%引き
導入期間後の価格入力 $4 / 100万トークン、出力 $20 / 100万トークン
提供状況Fairwind Program の信頼できるサイバー防御者へ順次提供中
一般提供時期は未発表。まず有料の API 利用者と Google AI Ultra 加入者から

公式ブログは一般公開について「できるだけ早く開発者、企業、一般ユーザーに提供する」と書くにとどめ、日付は示していません。API で指定するモデル ID も、この記事を書いている時点では公表を確認できていません。

出力上限が1Mトークンになった意味

今回の数字で目を引くのは、出力側の上限が64Kトークンから1Mトークンへ増えたことです。入力(コンテキスト)の長さではなく、1回の応答で生成できる量の話です。

Google は、何十万トークンも考えながら1本の流れで生成できる余地があると、難しい問題を一度で解ききる推論の深さが出ると説明しています。大規模なコード移行や長い調査レポートのように、途中で区切らずに最後まで書き切らせたい作業が想定されています。

裏返すと、上限まで出力させれば1回の呼び出しが高くつきます。出力100万トークンは、導入価格で $10、導入期間後は $20 です。エージェントに長時間の作業を任せるなら、思考と出力の量を抑える設定や、キャッシュ済み入力の割引を前提にした設計が必要になります。

ベンチマーク

公式ブログに載っている主な数値です。

ベンチマーク測っているものGemini 4 Argon
DeepSWE v1.1長い手順を伴う実務のソフトウェア開発77.9%(最高値と主張)
Vals Index金融・コーディング・法務・税務の経済的インパクト(米国GDPへの寄与で重み付け)首位と主張
Vals Finance Agent v2 / Harvey's Legal Agent Benchmark多段階の金融調査 / 法務の調査と起案首位級と主張(数値の記載なし)
AutomationBench(Zapier)業務フローの端から端までの実行51.3%で1位
LVBench長い動画の理解91.7%
CWE-bench v1脆弱性の修正68%で同率1位

DeepSWE v1.1 の比較について、9to5Google は Google の比較表として Claude Opus 5.5 が74.2%、GPT-6 Astra が74.1%と伝えています。GPT-6 Astra の74.1%は、GPT-6 Astra の記事で確認した OpenAI 公表値と一致します。どれも各社が自社の条件で測った数値で、第三者による同一条件の再測定ではない点には注意してください。

Google 社内ではすでに使われている

公式ブログによると、Argon は Google 社内の業務ですでに使われていて、数千人の社員が利用しています。紹介されている事例は次のとおりです。

  • 量子アルゴリズムの最適化: ボトルネックになっているサブルーチンの資源(量子ビット数とゲート数)の削減で、公開済みのベースラインを数分で40%上回った例
  • メモリ効率化: Argon のエージェント群がデータセンター全体のプロファイリング結果を分析して最適化を適用し、展開済みの分で300TiB超のメモリを解放。総計では500TiBから1PiBの削減を見込む
  • C/C++ から Rust への移行: re2 や libgav1 のような数万行規模のライブラリから、80万行を超える Fuchsia の Zircon カーネルまで、移行作業を進めている。重要なシステムなので、自動・手動の監査とテストを経てから本番に出すとしている

libgav1(Google のオープンソースの動画デコーダー)では、既存の Rust 移植版にあった3万2千行の SIMD コードを、コンパイラが自動でベクトル化できる安全な Rust に置き換えました。結果として、出力は同一のまま、Rust 移植版より2.7倍速いメモリ安全なデコーダーになったと報告されています。

なぜサイバー防御者から先に配るのか

Argon は、サイバー防御の能力を高めるように訓練されています。公式ブログは、重要なソフトウェアの脆弱性を自律的に発見し、検証し、修正パッチまで作れると説明しています。

この能力は攻撃にも転用できます。そこで Google は、一般公開の前に防御側へ先に渡し、システムを固める時間を作る方針を取りました。信頼できる防御者と Google 社内のチームには、サイバー関連のガードレールを外した状態で提供するとしています。

Fairwind Program とは

Fairwind Program は、Google が9月2日に始めた限定アクセスの制度です。対象は政府機関、Google Cloud の顧客、サイバーセキュリティのパートナーで、開始時点では次の3種類の組織を優先していました。

  • 政府と国のサイバー当局
  • 医療・通信・エネルギー・金融などの重要インフラ事業者
  • 多くの利用者を抱える基盤ソフトウェアの提供者

参加する組織は、利用者を社内のセキュリティ、インシデント対応、ペネトレーションテストのチームに限ることや、多要素認証などの保護を導入することに同意する必要があります。開始時点の参加パートナーは世界で650を超えていました。

開始当初に提供されたのは、同じ9月2日に発表された Gemini 3.8 Flash Cyber と、脆弱性の発見から修正までを自動で回す CodeMender の組み合わせです。Argon はその上位のモデルとして同じ枠組みで配られます。Fairwind に参加していない Google Cloud の顧客も、一般公開されているモデルと CodeMender は利用できると案内されています。

初期の成果として、Wiz が公共インフラを無償で守る取り組み(Scan for Good)で Argon を使い、世界の病院で使われる医療ソフトウェアに個人情報が漏れる重大な脆弱性を見つけた例が挙げられています。これまでのフロンティアモデルでは見つからなかったものだとしています。

一般公開前に強化している安全対策

公式ブログは、広く提供する前の安全対策を4つの領域で説明しています。

  1. 悪用の防止: Frontier Safety Framework に沿って、サイバー攻撃や CBRN(化学・生物・放射性物質・核)への悪用につながる要求を拒否しつつ、正当なデュアルユースの研究は妨げない設計にしている。モデル内部の活性化を監視して悪用を見つける技術も強化し、社内外のレッドチームが手動・自動の攻撃で検証した
  2. プロンプトインジェクション対策: 自動レッドチーミングと敵対的訓練により、Gray Swan の間接プロンプトインジェクション(IPI)ベンチマークで最も高い耐性を示したとしている
  3. ミスアライメントの監視: ユーザーの意図を超えた手段でタスクを達成しようとする挙動を防ぐため、思考過程(chain-of-thought)と行動を監視し、必要なら実行を止める。訓練中の監視結果を訓練に戻さないことで、監視を回避するような推論を学ばせないよう配慮したと説明している
  4. 実行環境の堅牢化: リスクの高い訓練や評価の前に、サンドボックス環境を隔離・封鎖する

あわせて、米国政府による公開前のモデルアクセスの任意の枠組みにも参加していると明記しています。

9月の Gemini の流れ

Argon の発表は、9月の一連の更新の締めくくりでもありました。

  • 9月2日: Gemini 3.8 Flash と 3.8 Flash Cyber を発表。3.7 Flash から3週間、6週間で3回目の Flash 更新。3.8 Flash の導入価格は入力 $0.75、出力 $3.75(100万トークンあたり)で、3.7 Flash と同じ
  • 9月2日: Fairwind Program を開始
  • 9月30日: Gemini 4 Argon を発表

3.8 Flash は複雑なタスクで推論ステップやツール呼び出しを増やす作りで、高い effort では出力トークンが増えることがあると Google 自身が書いています。効率を優先する用途には 3.7 Flash も引き続きサポートされます。

開発者が今できること

Fairwind に参加していない多くの開発者は、Argon をまだ使えません。いまの時点で取れる行動は次のあたりです。

  • 当面の実装は 3.8 Flash など公開済みのモデルで進める。長時間のエージェント作業でトークン消費が増える傾向は、Argon でも同じかそれ以上になると考えておく
  • 出力上限1Mトークンを前提にした使い方(大規模な移行や長い調査)を検討するなら、出力単価 $10(導入期間後は $20)で1回あたりの費用を見積もっておく
  • 脆弱性対応の自動化に関心がある組織は、Google Cloud 経由で CodeMender と公開モデルの組み合わせを試せる
  • 提供開始は有料 API 利用者と Google AI Ultra 加入者が先行すると予告されているので、Google の公式ブログと Gemini API のリリースノートを追う

まとめ

  • Gemini 4 Argon は、長く複雑な業務フロー向けの Google の新フロンティアモデルで、出力上限を64Kから1Mトークンへ広げた
  • DeepSWE v1.1 で77.9%、AutomationBench で51.3%、LVBench で91.7%と、Google は複数の分野で首位を主張している
  • サイバー防御の能力が高いため、まず Fairwind Program の防御者へガードレールを外して提供し、一般公開は安全対策を固めてからとしている
  • 導入価格は入力 $2・出力 $10(100万トークンあたり)。一般公開の日付とモデル ID は未発表

モデルの性能より先に「誰に、どの順番で渡すか」が発表の中心に置かれたことが、今回の特徴です。同じ時期の他社モデルは Claude Opus 5.5、GPT-6 Astra の記事で整理しています。

参考リンク

Gemini 3.6 Flash 最新事情 - 3.5 Flash-Lite / Flash Cyber 同時発表と Gemini 4 予告

Gemini 3.6 Flash 最新事情 - 3.5 Flash-Lite / Flash Cyber 同時発表と Gemini 4 予告

約17分

Google が2026年7月21日に発表した Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber の3モデルを一次ソースで整理します。今回 3.5 Pro は無し、Gemini 4 の事前学習開始を予告。約1Mコンテキスト、入力$1.50・出力$7.50、ナレッジカットオフ2026年3月、出力トークン約17%削減、reasoning effort と並列ツール、提供面までまとめます。

Gemini 3.5 Flash - 高速・低価格でコーディングとエージェントを強化(Pro はプレビュー)

Gemini 3.5 Flash - 高速・低価格でコーディングとエージェントを強化(Pro はプレビュー)

約8分

Google が2026年5月19日の I/O で一般提供を開始した Gemini 3.5 Flash を、公式情報を一次ソースに整理します。1Mトークンのコンテキスト、4段階の thinking、入力 $1.50 / 出力 $9.00 という価格、Terminal-Bench 2.1 や MCP Atlas などコーディング・エージェント系での向上、そして「3.1 Flash の3倍の価格」という注意点まで。あわせて、まだ GA していない Gemini 3.5 Pro(2Mコンテキスト・Deep Think、プレビュー段階)の現状も正確に区別して解説します。

Google ToolGrad とは何か - 「答えから先に作る」ツール利用データ生成の仕組みと実力

Google ToolGrad とは何か - 「答えから先に作る」ツール利用データ生成の仕組みと実力

約16分

Google Research が2026年9月10日にブログで紹介した ToolGrad は、LLM にツール呼び出しを学習させるためのデータを「実際に動くツール呼び出しの連鎖を先に組み立て、あとから質問文を付ける」answer-first 方式で生成するフレームワークです。TextGrad 由来の「テキストの勾配」という考え方、Proposer / Executor / Selector / Updater の4ステップ、生成成功率 99.8%、Gemma 3 ベースの ToolGrad-12B が BFCL で Gemini 2.5 Pro に 0.1 差まで迫った結果、公開されているコード・データ・モデル、著者が認める限界までを論文と公式ブログを一次ソースに整理します。