Google은 6월 3일 네이티브 오디오 입력을 지원하는 120억 매개변수 멀티모달 모델 Gemma 4 12B를 공개했다. 이 모델은 일부 고급 개인용 컴퓨터도 포함되는 하드웨어 범위에서 구동될 수 있다. 모든 요청을 원격 서비스로 보내고 싶지 않은 개발자가 로컬 음성과 멀티모달 프로젝트를 시도하기 쉬워졌다는 의미다.
회사는 16GB VRAM 또는 통합 메모리에서 모델을 로컬로 실행할 수 있다고 밝혔다. 이는 모델이 메모리에 들어간다는 주장이지, 16GB를 갖춘 모든 컴퓨터가 같은 속도나 구성을 지원한다는 보장은 아니다. 가속기 호환성, 양자화, 운영체제와 추론 소프트웨어가 실제 배포의 유용성을 좌우한다.
Google은 Apache 2.0 라이선스로 가중치를 공개하고 일반적인 로컬 및 클라우드 개발 도구에서 사용하는 방법을 문서화했다. 또 출시 당시 Gemma 제품군의 누적 다운로드가 1억5천만 건을 넘었다고 밝혔다. 이 수치는 Google이 제시한 것으로, 활성 배포 수나 Gemma 4 자체의 성능을 측정하지 않는다.
실질적인 매력은 통제권에 있다. 한 대의 기기에 들어가는 모델은 오프라인 실험과 데이터를 사용자 가까이에 두는 작업 흐름을 지원할 수 있다. 다만 이점은 애플리케이션, 하드웨어와 안전장치에 달려 있다. 가중치를 내려받을 수 있다고 유지보수가 사라지는 것은 아니며, 노트북 수준의 메모리 사용량도 지연이나 출력 품질을 설명하지 않는다.
Gemma와 호스팅 시스템을 비교하려면 한 가지 사양이 아니라 전체 작업을 시험해야 한다. 로딩 후 메모리 사용량, 응답 시간, 오디오 처리, 지원 가속기와 양자화의 영향을 확인할 필요가 있다. Google의 발표는 달성 가능한 출발점을 제시하지만, 실제 기기 시험이 이 주장의 적용 범위를 결정할 것이다.
다음에 주목할 점
노트북, GPU와 여러 추론 엔진을 대상으로 한 외부 시험을 통해 16GB 환경에서 실제로 유용한 로컬 경험을 제공하는 범위를 확인해야 한다.
출처
이 회고 기사는 2026년 8월 3일 Google의 발표, 개발자 안내서와 Gemma 개요를 바탕으로 작성됐다. 제품과 이용 현황에 관한 주장은 Google에 귀속된다. AI News of Today는 이 기사를 위해 모델을 시험하지 않았다.
가능한 경우 원문 자료와 현장 취재 보도로 연결합니다.