Google于6月9日发布Gemini 3.5 Live Translate,把它定位为连续语音翻译系统。公司称,该系统可自动识别70多种语言,并在一次会议中覆盖超过2000种语言组合。产品旨在让对话持续进行,不需要每个人先选择语言,再按僵化的独立轮次等待翻译。

Google表示,该模型力求保留语调、节奏和音高,而不是只把语音转化成文字。尤其在说话者打断、停顿或强调某个词组时,这些特征也会传递含义。公告描述了预期效果,但不能证明所有语言组合都具备同等的准确度或自然度。

公开预览通过Gemini Live API和Google AI Studio开放。Google Translate和Google Meet的整合被列为后续计划,因此预览版开放不等于Google面向消费者和办公场景的产品已经全面上线。开发前应查阅当前文档,确认价格、地区访问和模型标识。

对旅行、会议、客服和语言学习而言,翻译层能在人们交谈时持续工作,因而具有实际价值。这些场景也更容易暴露局限。口音、语言混用、声音重叠和背景噪声,都可能影响一个在安静演示中表现良好的系统。

因此,语言数量只是起始规格。有效比较需要使用相同录音、说话者和评分方法,并由母语人士判断语气和含义是否保留。在这类证据出现前,Google有关覆盖范围和质量的说法应继续归于公司,而不能变成最佳翻译器的排名结论。

接下来值得关注

下一步有价值的证据将是外部多语言测试,以及Google Translate、Meet、地区和价格方面的正式上线细节。

信息来源

这份回顾性发布档案于2026年8月3日根据Google公告、模型卡和API文档整理,并参考Ars Technica报道。AI News of Today未为本文进行多语言测试。

我们尽可能链接原始文件,并采用一手采访资料。

  1. Google announcement原始来源 · 2026年6月9日
  2. Google DeepMind audio model card原始来源 · 2026年6月9日
  3. Gemini API model documentation背景资料 · 2026年6月9日
  4. Ars Technica coverage媒体报道 · 2026年6月9日