Google a présenté Gemma 4 12B le 3 juin. Ce modèle multimodal de 12 milliards de paramètres accepte nativement les entrées audio. Cette sortie place un nouveau modèle de Google à la portée matérielle de certains ordinateurs personnels haut de gamme et facilite les projets locaux de voix et de multimodalité pour les développeurs qui ne veulent pas envoyer chaque requête à un service distant.

Selon l'entreprise, le modèle peut fonctionner en local avec 16 Go de VRAM ou de mémoire unifiée. Il s'agit d'une indication de capacité mémoire, et non de la promesse que tous les ordinateurs équipés de 16 Go offriront la même vitesse ou accepteront la même configuration. La compatibilité de l'accélérateur, la quantification, le système d'exploitation et le logiciel d'inférence déterminent aussi l'utilité réelle du déploiement.

Google a publié les poids sous licence Apache 2.0 et documenté des procédures pour plusieurs outils courants de développement local et dans le cloud. Le groupe a aussi indiqué que la famille Gemma avait dépassé 150 millions de téléchargements au moment du lancement. Ce chiffre vient de Google et ne mesure ni les déploiements actifs ni les performances propres à Gemma 4.

Le principal intérêt tient au contrôle. Un modèle qui tient sur une seule machine peut servir à des essais hors ligne et à des usages où les données restent plus proches de l'utilisateur. Ces avantages dépendent encore de l'application, du matériel et des protections entourant le modèle. Des poids téléchargeables ne rendent pas le déploiement autonome, et une empreinte mémoire adaptée à un ordinateur portable ne répond pas aux questions de latence ou de qualité des résultats.

Les développeurs qui comparent Gemma à des services hébergés doivent tester la charge de travail complète plutôt qu'une seule caractéristique. La mémoire utilisée après chargement, le temps de réponse, le traitement audio, les accélérateurs pris en charge et l'effet de la quantification font partie des mesures utiles. L'annonce de Google fixe un point de départ accessible, mais seuls des essais sur des machines réelles diront jusqu'où cette promesse peut s'étendre.

La suite à surveiller

Des essais extérieurs à Google sur différents ordinateurs portables, GPU et moteurs d'inférence devront montrer quand la promesse des 16 Go se traduit par une expérience locale réellement utile.

Sources

Ce dossier rétrospectif sur le lancement a été préparé le 3 août 2026 à partir de l'annonce, du guide pour développeurs et de la présentation de Gemma publiés par Google. Les affirmations sur le produit et son adoption restent attribuées à Google. AI News of Today n'a pas testé le modèle pour cet article.

Dans la mesure du possible, nous renvoyons aux documents d'origine et aux témoignages directs.

  1. Google announcementSource primaire · 3 juin 2026
  2. Google Developers guideSource primaire · 3 juin 2026
  3. Google DeepMind Gemma overviewContexte · 3 juin 2026