Gemini 3.1 Flash Live と Flash TTS まとめ — リアルタイム音声AIが本格普及フェーズへ

Gemini 3.1 Flash Live と Flash TTS まとめ — リアルタイム音声AIが本格普及フェーズへ

作成日:
読了:約10分
更新日:
この記事を読む人におすすめPR / Amazonアソシエイト

当サイトは Amazon.co.jp を宣伝しリンクすることで紹介料を得る手段を提供する、Amazonアソシエイト・プログラムの参加者です。価格・在庫はリンク先の最新情報をご確認ください。

2026年3〜4月、Google は音声AIまわりで2つの大型リリースを行いました。

  • 2026年3月26日:Gemini 3.1 Flash Live(低レイテンシのマルチモーダル音声モデル)
  • 2026年4月15日:Gemini 3.1 Flash TTS(新世代のテキスト読み上げモデル)

「リアルタイムに会話するAI」「自然な多言語音声を生成するAI」のどちらも、ようやく プロダクション運用に耐える品質と運用性 が揃ってきた印象です。

この記事では、両モデルのポイントと使い分け、実際の利用方法をまとめます。

Gemini 3.1 Flash Live — リアルタイム音声マルチモーダル

概要

項目内容
リリース日2026年3月26日
入出力音声・映像・テキスト同時処理
対応言語90以上
特徴低レイテンシ、ツール呼び出し対応、エージェント向け

「話しながら、見せながら、ツールを呼ぶ」が同じセッションで自然に行えるモデルです。

前世代(Gemini 2.5 Flash Native Audio)からの強化点

  • レイテンシと音質の改善
  • ピッチ・ペースなどの 音響的ニュアンス の認識精度向上
  • 実環境ノイズフィルタリングの大幅強化
  • 会話メモリ長が 倍増、長時間セッションが安定
  • システムプロンプトの遵守度向上

実用面では「カフェの中でもまともに聞き取ってくれる」「1時間続く打ち合わせの議事録ボットが現実的」というレベル感です。

Gemini Live / Search Live との連携

このモデルは、Gemini Live(音声でGeminiと会話する体験)と Search Live(音声+カメラで検索)を 200カ国以上 にロールアウトする原動力になっています。Google レンズと連携した「カメラに映ったものを声で質問する」ユースケースも、ここから大幅に強化されました。

想定するユースケース

  • 通話・会議の リアルタイムアシスタント
  • 教育・学習用の 対話型チューター
  • 見守り・サポート系の 音声インターフェース
  • 店頭・受付の 音声+映像対応エージェント

Gemini 3.1 Flash TTS — 新世代の表現力豊かなTTS

概要

項目内容
リリース日2026年4月15日
対応言語70以上
ベンチマークArtificial Analysis TTSリーダーボード Eloスコア 1,211
特徴マルチスピーカー対話、自然言語による音声制御、SynthID透かし

注目ポイント

1. 自然言語で音声をコントロールできる

「ささやくように」「ゆっくり、丁寧に」「少し驚いた感じで」というような指示を 自然言語のオーディオタグ として与えられます。SSMLを書かずにスタイル制御できる点が大きな利点。

指示例
[whispering] そっと教えて。
[excited] やっと届いた、夢のチケット!
[calm, slow] 深呼吸をしてから、続けましょう。

2. ネイティブのマルチスピーカー対話

複数話者が交互に話す音声を、1リクエストで自然な抑揚 つきで生成できます。物語や教材、podcast 用途で強い。

3. SynthID 透かしの埋め込み

生成された音声には人間には知覚できない SynthID 透かし が埋め込まれます。AI生成音声の検証・流出対策として、運用上もメリット大。

4. ベンチマーク Elo 1,211 の品質

Artificial Analysis のTTSリーダーボードで Elo 1,211 を獲得。商用TTSの中でも上位の自然さを保証する数字です。

使い方の最小例

Flash Live を Live API で呼ぶ

公式の Google Gen AI SDK(@google/genai)では、ai.live.connect() で WebSocket セッションを張り、音声は 16kHz・16bit の PCM を base64 にして sendRealtimeInput() で送ります(2026-10-07 に公式ドキュメントの形へ修正)。

Gemini Live API のクライアント例(@google/genai)
import { GoogleGenAI, Modality } from "@google/genai";
 
const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
 
const session = await ai.live.connect({
  model: "gemini-3.1-flash-live-preview",
  config: {
    responseModalities: [Modality.AUDIO],
    systemInstruction: "あなたは丁寧な音声アシスタントです。",
  },
  callbacks: {
    onopen: () => console.log("connected"),
    onmessage: (message) => handleServerMessage(message), // 受信した音声チャンクを再生する
    onerror: (e) => console.error(e),
    onclose: () => console.log("closed"),
  },
});
 
// マイクから取得した 16kHz / 16bit PCM のチャンクを送る
session.sendRealtimeInput({
  audio: { data: pcmChunk.toString("base64"), mimeType: "audio/pcm;rate=16000" },
});

Flash TTS を REST から呼ぶ(イメージ)

cURL での生成例(イメージ)
curl https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-flash-tts-preview:generateContent \
  -H "x-goog-api-key: $GOOGLE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "parts": [{ "text": "[calm, slow] 深呼吸をしてから、続けましょう。" }]
    }],
    "generationConfig": {
      "responseModalities": ["AUDIO"],
      "speechConfig": {
        "voiceConfig": { "prebuiltVoiceConfig": { "voiceName": "Aoede" } }
      }
    }
  }'

戻り値は音声バイト列(PCM/Opusなど、設定による)です。前回 TTS API比較記事 でも触れたように、Gemini系のTTSは PCM 出力時にWAVヘッダを付与するなどの処理が必要なケースがあります。

どちらを使うか — 用途別の選び方

シーン推奨モデル
双方向のリアルタイム対話(音声+カメラ)Flash Live
録音/録画音声の自動応答Flash Live
物語・解説などの 再生用音声生成Flash TTS
多言語ナレーション・教材音声Flash TTS
音声メモ/議事録要約Flash Live + 別モデル

「話す体験」=Flash Live、「読み上げ体験」=Flash TTS、というシンプルな使い分けが分かりやすいです。

競合との関係

  • OpenAI Realtime API:speech-to-speech に強み、関数呼び出し対応で安定
  • ElevenLabs:TTSの表現力に特化、ボイスクローン対応
  • Google Gemini 3.1 Flash Live / TTS:マルチモーダル+多言語+SynthIDで優位

「マルチモーダル × 多言語 × Google エコシステムへの統合」という条件では、現時点では Gemini 系列が一歩抜けた印象です。

その後の動き(2026年10月時点)

本記事の2モデルは、Gemini API のモデル一覧では現在もプレビュー版のまま「Legacy」扱いになり、後継の GA モデルが出ています(モデル一覧、changelog、料金ページ)。

用途本記事のモデル(プレビュー)後継(GA)
リアルタイム音声gemini-3.1-flash-live-previewgemini-3.8-live、gemini-3.8-live-extended-thinking(2026年9月15日 GA)
TTSgemini-3.1-flash-tts-previewgemini-3.8-flash-tts、gemini-3.8-flash-lite-tts(2026年9月22日 GA)

Live API の公式ドキュメントでは gemini-3.8-live が既定のモデルとして案内されています。TTS も 3.8 世代で GA になり、同時にボイスデザインや声の複製、150種類以上のボイスライブラリが追加されました。3.8 Flash TTS の価格は2026年12月31日まで入力 $0.50 / 出力 $9.00(100万トークンあたり、2027年1月1日から $1.00 / $18.00)で、3.1 Flash TTS Preview の入力 $1.00 / 出力 $20.00 より安く設定されています。新規に組むなら、プレビュー版ではなく 3.8 世代の GA モデルから検討するのが無難です。

まとめ

  • 2026年3月26日 Gemini 3.1 Flash Live:リアルタイム音声マルチモーダル
  • 2026年4月15日 Gemini 3.1 Flash TTS:表現力豊かなTTSと自然言語スタイル制御
  • いずれも 多言語・低レイテンシ・SynthID対応 で運用面の心配が大きく減った
  • リアルタイム対話 → Flash Live、生成音声 → Flash TTS の使い分けが自然
  • 音声AIは「実験」から「プロダクション運用フェーズ」へ

過去に書いた Gemini TTS / Google Cloud TTS 比較記事 の頃と比べても、世代交代のテンポが一段速くなっています。

参考リンク

Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

Gemini 4 Argon 最新事情 - サイバー防御者から段階公開される Google の新フロンティアモデル

約12分

Google が2026年9月30日(米国時間)に発表した Gemini 4 Argon を公式ブログで整理します。出力上限は64Kから1Mトークンへ、DeepSWE v1.1 で77.9%、導入価格は入力$2・出力$10。一般公開は未定で、まず Fairwind Program のサイバー防御者へ配られる理由、安全対策、社内でのRust移行事例、開発者が今できることまでまとめます。

Gemini 3.6 Flash 最新事情 - 3.5 Flash-Lite / Flash Cyber 同時発表と Gemini 4 予告

Gemini 3.6 Flash 最新事情 - 3.5 Flash-Lite / Flash Cyber 同時発表と Gemini 4 予告

約17分

Google が2026年7月21日に発表した Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber の3モデルを一次ソースで整理します。今回 3.5 Pro は無し、Gemini 4 の事前学習開始を予告。約1Mコンテキスト、入力$1.50・出力$7.50、ナレッジカットオフ2026年3月、出力トークン約17%削減、reasoning effort と並列ツール、提供面までまとめます。

Gemini 3.5 Flash - 高速・低価格でコーディングとエージェントを強化(Pro はプレビュー)

Gemini 3.5 Flash - 高速・低価格でコーディングとエージェントを強化(Pro はプレビュー)

約8分

Google が2026年5月19日の I/O で一般提供を開始した Gemini 3.5 Flash を、公式情報を一次ソースに整理します。1Mトークンのコンテキスト、4段階の thinking、入力 $1.50 / 出力 $9.00 という価格、Terminal-Bench 2.1 や MCP Atlas などコーディング・エージェント系での向上、そして「3.1 Flash の3倍の価格」という注意点まで。あわせて、まだ GA していない Gemini 3.5 Pro(2Mコンテキスト・Deep Think、プレビュー段階)の現状も正確に区別して解説します。