Google于6月3日发布Gemma 4 12B。这是一款拥有120亿参数、支持原生音频输入的多模态模型。新模型所需的硬件范围覆盖部分高端个人电脑,让不希望把每次请求都发送到远程服务的开发者更容易开展本地语音和多模态项目。

公司称,该模型可在配备16 GB显存或统一内存的设备上本地运行。这只是关于模型能否装入内存的说法,并不保证所有16 GB设备都能达到相同速度,甚至不保证支持同样的配置。加速器兼容性、量化方式、操作系统和推理软件都会影响本地部署是否真正实用。

Google依据Apache 2.0许可发布了模型权重,并为常见的本地及云端开发工具提供了使用路径。公司还称,Gemma系列在发布时已累计下载超过1.5亿次。该数字来自Google,既不代表活跃部署量,也不反映Gemma 4本身的性能。

本地模型的实际吸引力在于控制权。一台设备能够容纳模型,便可支持离线实验,也能让数据更接近用户。不过,这些好处仍取决于应用、硬件和模型周边的安全措施。权重可下载不等于部署无需维护,适合笔记本的内存占用也不能回答延迟和输出质量问题。

开发者比较Gemma和托管服务时,应测试完整工作负载,而不是只看一项规格。值得检查的指标包括加载后的内存占用、响应时间、音频处理、支持的加速器以及量化带来的影响。Google的发布给出了一个可实现的起点,实际设备测试将决定这一说法适用于多大范围。

接下来值得关注

需要在笔记本、GPU和不同推理引擎上进行外部测试,才能判断哪些16 GB设备确实能提供实用的本地体验。

信息来源

这份回顾性发布档案于2026年8月3日根据Google的公告、开发者指南和Gemma概览整理。有关产品和采用情况的说法仍归于Google,AI News of Today未为本文测试该模型。

我们尽可能链接原始文件,并采用一手采访资料。

  1. Google announcement原始来源 · 2026年6月3日
  2. Google Developers guide原始来源 · 2026年6月3日
  3. Google DeepMind Gemma overview背景资料 · 2026年6月3日