Googleは6月9日、連続音声翻訳システムのGemini 3.5 Live Translateを発表した。同社によれば、70を超える言語を自動検出し、1つの会議で2000を超える言語の組み合わせを扱える。各参加者が言語を選び、区切られた発話の順番を待つことなく、会話を続けられるよう設計されている。
Googleは、言葉だけに変換するのではなく、抑揚、話す速さ、声の高さを保つことを目指すと説明した。遮り、ためらい、強調がある会話では、こうした特徴も意味を伝える。発表は目標とする動作を示すが、対応するすべての言語ペアで精度や自然さが同等だと証明するものではない。
Gemini Live APIとGoogle AI Studioで公開プレビューが始まった。Google TranslateとGoogle Meetへの統合は今後の追加機能として発表されており、プレビューへのアクセスと、消費者および業務向け製品全体での展開完了を混同してはいけない。導入前には最新資料で価格、地域、モデルIDを確認する必要がある。
翻訳レイヤーが会話中に動き続けるため、旅行、会議、顧客対応、語学学習に役立つ可能性がある。一方、これらの場面では限界も見えやすい。アクセント、複数言語の混在、重なる声、周囲の騒音は、整ったデモで良好なシステムにも影響し得る。
言語数は出発点の仕様にすぎない。意味と調子が残るかを母語話者が評価し、同じ録音、話者、採点方法で各システムを比較する必要がある。その証拠がない段階では、Googleの対応範囲と品質に関する説明は同社の主張であり、最良の翻訳システムを決める順位ではない。
今後の注目点
外部の多言語テストと、Google Translate、Meet、対象地域、価格について確認済みの提供情報が次の重要な材料になる。
情報源
この発表を振り返る記事は、Googleの発表、モデルカード、API資料に加え、背景情報としてArs Technicaの記事を使い、2026年8月3日に作成した。AI News of Todayは今回、多言語テストを実施していない。
可能な限り、一次資料や現場取材に基づく報道へのリンクを掲載しています。