1. Gemini 3.8 LiveにLive Avatarが追加

Googleは、音声対話モデル「Gemini 3.8 Live」に映像アバターを組み合わせた「Gemini 3.8 Live with Live Avatar」を、企業向けに一般提供(GA)しました。発表は2026年9月24日(米国時間)で、Google Cloud公式ブログは9月25日付でGAを告知しています。提供先は企業向けAIエージェント基盤「Gemini Enterprise」と、開発者向けの「Live API」です。出典:Google Cloud公式ブログ。

Gemini 3.8 Live with Live AvatarのGAを告知するGoogle Cloud公式ブログ
Google Cloud公式ブログ(2026年9月25日付)のスクリーンショット。Live Avatarの一般提供開始を告知しています。

これまでの音声AIは「声だけ」でした。Live Avatarは、その対話に低遅延の映像ストリーミングを組み合わせ、話す内容に合わせて口の動きや表情を生成します。Googleはこれを「リアルタイムの視覚的な存在感(real-time visual presence)」と説明しています。画面の向こうに人が立っているように見える案内役を、ソフトウェアとして置けるようになったという位置づけです。

注意したいのは、これが企業向けの基盤機能であり、個人のGeminiアプリにアバターが付いた話ではない点です。無料プランや個人向け有料プランで今日から使える機能ではありません。まずは自社がGemini Enterpriseの対象になるのかを確認するところから始まります。

2. 97言語対応と「考えながら話す」の中身

Live Avatarは97言語に対応し、話されている言語を自動で判別します。会話の途中で言語が切り替わっても、その音声に合わせた口の動きと表情を映像として生成します。多言語の受付や案内を、言語ごとに別の担当者を置かずに扱える可能性があるということです。

Gemini 3.8 Live with Live Avatarを紹介するGoogle公式発表ページ
Google公式発表ページ(2026年9月24日付)のスクリーンショット。ライブ対話機能と低遅延の映像配信を組み合わせた仕組みを説明しています。

土台になるGemini 3.8 Liveは、音声から音声を直接生成する方式です。発話の途中で割り込まれても文脈を保ち、会話を止めずに裏側でツールを呼び出す動作にも対応します。「在庫を確認しますね」と話しながら在庫APIを叩き、待ち時間の沈黙を減らすといった使い方が想定されています。

もう一つの特徴は、生成された音声と映像のすべてに、人の目には見えない電子透かし「SynthID」が埋め込まれることです。AIが生成した映像であることを後から判別できる仕組みで、なりすまし対策として用意されています。ただし、視聴者が自分でSynthIDを確認できるわけではないため、接客で使う場合はAIが応対していることを画面や音声で明示する運用が別途必要です。

なお、上位版の「Gemini 3.8 Live Extended Thinking」は、今回のGAには含まれず限定プレビューのままです。より深く考えさせる用途を前提に検討している場合は、提供状況が異なる点に注意してください。

3. 導入前に確認する4項目

できることだけを見て判断すると、要件に合わないまま検証に入ってしまいます。公開情報の時点で分かっている制限は、次の4項目に整理できます。

確認項目公開情報の内容判断のポイント
提供地域米国とEUのエンドポイントで提供日本国内でのデータ処理条件は公式告知に明記がない。個人情報を扱う応対では要確認
カスタムアバター参照画像から独自の顔を作れるが、Googleの許可リストに登録され審査を通った企業に限定。既製アバターのライブラリは利用可能自社タレントや店長の顔で作る前提なら、まず許可の可否を確認する
連続利用時間モデルカードでは「数時間ではなく数分程度の連続対話」を想定と説明長時間の常設受付には向かない。1件ずつ完結する用件から選ぶ
出力の上限アバター利用時の出力は24Kトークンに制限(コンテキストは最大128Kトークン)長い説明を一気に読み上げる用途は分割設計が必要

加えて、料金は今回の公式ブログに金額の記載がなく、Google Cloudの料金ページで確認する案内になっています。第三者サイトには単価の記載も見られますが、見積りは必ず公式の料金ページと営業窓口で確認してください。音声と映像を扱うため、テキストのみのAI利用とは費用の出方が変わります。

もう一点、モデルカードは知識のカットオフを2025年1月とし、ハルシネーション(誤った内容の生成)や応答の遅延・タイムアウトが起こりうることも明記しています。価格や在庫のような変動する情報は、モデルの知識に任せず、必ず自社データを参照させる設計が前提になります。

4. 接客・案内での使いどころ

Googleは導入事例として、インドのEqual AIが9つのインド言語で1日100万件を超えるライブ通話を処理していることを挙げています。ほかにCox Automotive(Autotrader)のショッピングアシスタント、SalesforceのAgentforceとの連携などが紹介されています。いずれも大規模な事例ですが、そこから使いどころの共通点は読み取れます。

  • 同じ質問が繰り返される窓口:営業時間、持ち物、料金プラン、アクセスなど、答えが決まっている用件。
  • 多言語の一次対応:インバウンド向けの施設案内や、外国人スタッフ向けの手順説明。
  • 受付の入口:ホテルのチェックイン、来店受付、保険の請求受付など、聞き取って次の担当へ渡す役割。
  • 画面を見ながらの説明:カメラ映像や画面共有を音声と同時に理解できるため、「これはどう使うのか」に答える場面。

逆に向かないのは、判断の責任が重い用件です。クレーム対応、契約内容の最終確認、医療や法務に関わる助言などは、AIアバターで完結させず人へつなぐ設計にします。「数分で終わる用件をAIが受け、それ以外は人に渡す」という線引きが現実的です。

音声を扱う業務の効率化という点では、応対の録音を文字にして振り返る方法も併用できます。文字起こし側の選択肢はMAI-Transcribe-2の公開で確認する4項目も参考にしてください。

5. 中小企業が先に決めておくこと

アバターは見た目のインパクトが大きく、「とりあえず作ってみる」に流れやすい技術です。導入の成否は、映像の質よりも運用の設計で決まります。着手前に次の4点を決めておくと、検証が判断材料になります。

  1. 対象の用件を1つに絞る:「よくある質問すべて」ではなく、「営業時間と予約方法の案内だけ」のように限定します。正解が確認できる範囲から始めます。
  2. 参照させる情報を確定する:料金表や案内文の最新版を1セット用意し、そこにない内容は答えさせない方針を決めます。古い資料が混在すると、流暢な誤答が生まれます。
  3. 人に渡す条件を書き出す:「金額の交渉」「苦情」「例外対応」などを列挙し、その場合の引き継ぎ方法まで決めておきます。
  4. AI応対であることの表示を決める:画面表示と冒頭の音声の両方で伝えるか、記録の扱いをどう案内するかを、公開前に社内で確認します。

MIRAINAの視点:アバター接客の相談をいただくと、最初の論点は「顔をどうするか」になりがちです。しかし効果を左右するのは、答えられる範囲の狭さと、人に渡す線の明確さです。まず既製アバターで1つの用件を試し、応対件数だけでなく「人が引き取った件数」と「誤答の内容」を記録してください。その2つが、拡大するかどうかの判断に直結します。日本国内での提供条件が固まるまでは、社内向けの案内や多言語の手順説明など、個人情報を扱わない場面での検証が安全です。

6. まとめ:一つの窓口から試す

Gemini 3.8 LiveのLive Avatarは、97言語の音声対話に映像の存在感を加えた企業向け機能です。一方で、提供地域は米国とEU、カスタムアバターは許可制、連続対話は数分程度という制限があります。できることと制限を並べて、自社の用件が「数分で終わり、答えが確認できる範囲」に収まるかを先に見極めてください。MIRAINAの生成AI活用支援では、対象業務の切り出しから運用ルールづくりまでを支援しています。

参考リンク(2026年9月25日確認)