Google Gemma 4 リリースまとめ — 31B Dense / 26B MoE / E4B / E2B のオープンソース4モデル徹底解説

Google Gemma 4 リリースまとめ — 31B Dense / 26B MoE / E4B / E2B のオープンソース4モデル徹底解説

作成日:
読了:約8分
更新日:
この記事を読む人におすすめPR / Amazonアソシエイト

当サイトは Amazon.co.jp を宣伝しリンクすることで紹介料を得る手段を提供する、Amazonアソシエイト・プログラムの参加者です。価格・在庫はリンク先の最新情報をご確認ください。

NOTE

2026年7月時点の続報: 本記事の公開後に 12B Unified(音声対応マルチモーダル)が追加され、Gemma 4 は現在 5 モデル構成になりました(本文の 31B Dense / 26B MoE / E4B / E2B に追加)。ベンチマーク値は公開時点のもので現在も有効です。

追記(2026-10-07): 2026年6月には、12B Unified のほかに量子化対応学習版の Gemma 4 QAT と、拡散方式でテキストを生成する実験的モデル DiffusionGemma も公開されています。公式モデルカードでは、E2B / E4B / 12B は音声入力(最大30秒)にも対応し、コンテキストは E2B / E4B が128K、12B 以上が256K です(Gemma 4 モデルカード、Gemma 公式サイト)。

2026年4月2日、Googleはオープンソースモデル群 「Gemma 4」 を発表しました。Geminiの研究成果をベースに、ローカル/エッジで自由に動かせる4種のモデルを揃えた構成で、最先端クローズドモデルに肩を並べる性能とライセンスの自由度が同時に注目されています。

この記事では、Gemma 4 の4モデルラインナップと性能、特徴をまとめます。

ラインナップ — 4モデル構成

Gemma 4 は以下の4モデルで提供されます。

モデル種別パラメータ想定用途
Gemma 4 31B DenseDense(密行列)310億フラッグシップ、サーバー推論
Gemma 4 26B MoEMixture-of-Experts総260億 / 推論時3.8B有効コスパ重視のサーバー推論
Gemma 4 E4Bエッジ向け約4B相当モバイル・PC・IoTゲートウェイ
Gemma 4 E2Bエッジ向け約2B相当スマートフォン・組込み機器

31B Dense — フラッグシップ

256K の長コンテキストに対応し、1モデルでサーバー側のヘビー推論を担う設計です。マルチモーダル(画像入力)にも対応します。

26B MoE — バリューリーダー

総パラメータ260億のうち、推論時に有効になるのは約3.8B という MoE 構成。31B Dense に近い性能を、より小さい計算コストで実現する位置づけです。

E4B / E2B — エッジ向け

スマートフォンやIoT機器でのローカル推論を意識したエッジモデル。メモリ効率を重視した量子化と、軽量化されたアテンション設計が施されています。

性能ハイライト

公式が示すベンチマーク数値の中で、特に印象的なものを抜粋します。

ベンチマークGemma 4 31B DenseGemma 4 26B MoE
AIME 2026(数学競技)89.2%88.3%
LiveCodeBench v6(コーディング)80.0%77.1%
数学スコア向上幅20.8% → 89.2%(前世代比)—

ポイントは以下の通りです。

  • 数学競技ベンチで 89.2% という、現行クローズドモデルと並ぶスコア
  • LiveCodeBench v6 で 80.0%、コーディング評価でも実用域
  • 26B MoE は 31B Dense に対して わずかな差で追従、コスパが極めて高い

共通の特徴

4モデル共通で備える特徴を整理します。

  • 思考モード(Thinking Mode):推論ステップを内部で展開して回答品質を高める
  • 関数呼び出し(Function Calling):エージェント用途に標準対応
  • 構造化 JSON 出力:スキーマ準拠の出力を直接生成
  • 140 以上の言語で事前学習:日本語含むマルチリンガル(公式モデルカードでは、すぐに使える対応言語は35以上と表記)
  • テキスト+画像入力:すべてのモデルで画像入力に対応

オープンソースライセンスでこれだけの機能が揃ったのは大きく、エージェント基盤としての適性が一気に高まりました。

ローカルで触ってみる

Hugging Face / Ollama / vLLM など、主要なランタイムで配布されています。最もカジュアルに試せるのは Ollama です。

Ollama で Gemma 4 を動かす(例)
ollama pull gemma4:31b
ollama run gemma4:31b "TypeScriptでDebounce関数を書いて"

Hugging Face の Transformers から使うパターンも一般的です。

Transformers で Gemma 4 を呼び出す(例)
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
 
model_id = "google/gemma-4-31b-it"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto",
)
 
prompt = "TypeScriptでDebounce関数を書いて"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

エッジ向けE2B / E4B は、モバイル端末向けランタイム(MediaPipe LLM Inference / llama.cpp など)から呼び出すパスがメインになります。

ユースケース別の使い分け

用途おすすめモデル
GPUサーバーで本格推論31B Dense
GPUサーバーでコスパ重視26B MoE
ノートPC・ローカル開発機E4B
スマートフォン・組込みE2B

エージェントを「サーバー側=31B / 26B MoE、エッジ側=E4B / E2B」という二段構成で組むと、レイテンシ・コスト・プライバシーをバランスよく扱えます。

まとめ

  • 2026年4月2日、Googleが Gemma 4 をオープンソースで公開
  • 31B Dense / 26B MoE / E4B / E2B の4モデル構成
  • AIME 2026 で 89.2%、LiveCodeBench v6 で 80.0% など、性能はクローズドモデル並み
  • 思考モード/関数呼び出し/JSON 出力/140言語/画像入力を 全モデル で対応
  • ローカル推論の選択肢として、もはや見過ごせない存在に

「クローズドAPIに頼らず社内基盤を組みたい」というニーズに対して、Gemma 4 は現実的な答えになり得るラインナップです。

参考リンク

Google DiffusionGemma - 拡散モデルでテキストを「並列生成」する実験的オープンモデル

Google DiffusionGemma - 拡散モデルでテキストを「並列生成」する実験的オープンモデル

約8分

Google DeepMind が2026年6月10日に公開した DiffusionGemma は、テキストを1トークンずつ左から右へ生成する従来の自己回帰(autoregressive)方式ではなく、ノイズから複数トークンを並列にデノイズして生成する「拡散(diffusion)」方式のオープンウェイトモデルです。仕組み(Uniform State Diffusion・双方向アテンション・256トークンの並列デノイズ)、H100で1,000トークン/秒超という速度、Gemma 4 比での品質トレードオフ、実験的という位置づけまで、Google 公式情報を一次ソースに整理します。

Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

約12分

Google が2026年9月30日(米国時間)に発表した Gemini 4 Argon を公式ブログで整理します。出力上限は64Kから1Mトークンへ、DeepSWE v1.1 で77.9%、導入価格は入力$2・出力$10。一般公開は未定で、まず Fairwind Program のサイバー防御者へ配られる理由、安全対策、社内でのRust移行事例、開発者が今できることまでまとめます。

Google ToolGrad とは何か - 「答えから先に作る」ツール利用データ生成の仕組みと実力

Google ToolGrad とは何か - 「答えから先に作る」ツール利用データ生成の仕組みと実力

約16分

Google Research が2026年9月10日にブログで紹介した ToolGrad は、LLM にツール呼び出しを学習させるためのデータを「実際に動くツール呼び出しの連鎖を先に組み立て、あとから質問文を付ける」answer-first 方式で生成するフレームワークです。TextGrad 由来の「テキストの勾配」という考え方、Proposer / Executor / Selector / Updater の4ステップ、生成成功率 99.8%、Gemma 3 ベースの ToolGrad-12B が BFCL で Gemini 2.5 Pro に 0.1 差まで迫った結果、公開されているコード・データ・モデル、著者が認める限界までを論文と公式ブログを一次ソースに整理します。