گوگل در ۳ ژوئن Gemma 4 12B را معرفی کرد، مدلی چندرسانهای با ۱۲ میلیارد پارامتر که ورودی صوتی را بهصورت بومی میپذیرد. این عرضه، مدل جدید گوگل را در محدوده سختافزاری برخی رایانههای شخصی قدرتمند قرار داد و پروژههای محلی صوتی و چندرسانهای را برای توسعهدهندگانی که نمیخواهند هر درخواست را به سرویس دوردست بفرستند دسترسپذیرتر کرد.
شرکت گفت مدل با ۱۶ گیگابایت VRAM یا حافظه یکپارچه بهصورت محلی اجرا میشود. این ادعایی درباره جا شدن در حافظه است، نه تضمین اینکه هر رایانه ۱۶ گیگابایتی همان سرعت یا همان پیکربندی را پشتیبانی کند. سازگاری شتابدهنده، کوانتیزهسازی، سیستمعامل و نرمافزار استنتاج هم تعیین میکنند یک استقرار محلی در عمل مفید باشد یا نه.
گوگل وزنها را با مجوز Apache 2.0 منتشر کرد و راههای استفاده با ابزارهای رایج توسعه محلی و ابری را توضیح داد. همچنین گفت خانواده Gemma تا زمان عرضه از ۱۵۰ میلیون دانلود عبور کرده بود. این رقم متعلق به گوگل است و تعداد استقرارهای فعال یا عملکرد خود Gemma 4 را اندازه نمیگیرد.
مزیت عملی اصلی، کنترل است. مدلی که روی یک دستگاه جا میشود میتواند برای آزمایشهای آفلاین و جریانهایی به کار رود که داده را نزدیکتر به کاربر نگه میدارند. این مزایا همچنان به برنامه، سختافزار و تدابیر حفاظتی پیرامون مدل وابستهاند. وزن قابل دانلود استقرار را بینیاز از نگهداری نمیکند و اندازه حافظه مناسب لپتاپ نیز مسئله تأخیر یا کیفیت خروجی را حل نمیکند.
توسعهدهندگانی که Gemma را با سامانههای میزبانیشده مقایسه میکنند باید کل کار را آزمایش کنند، نه یک مشخصه را. مصرف حافظه پس از بارگذاری، زمان پاسخ، پردازش صوت، شتابدهندههای پشتیبانیشده و اثر کوانتیزهسازی از بررسیهای مفیدند. اعلام گوگل نقطه شروع دستیافتنی را نشان میدهد، اما آزمایش روی دستگاه واقعی دامنه این ادعا را روشن میکند.
در ادامه چه چیزی مهم است
آزمایشهای بیرونی روی لپتاپها، GPUها و موتورهای استنتاج مختلف باید نشان دهند ادعای ۱۶ گیگابایت در کجا به تجربه محلی واقعاً مفید تبدیل میشود.
منابع
این پرونده بازنگرانه عرضه در ۳ اوت ۲۰۲۶ بر پایه اعلام گوگل، راهنمای توسعهدهندگان و مرور Gemma تهیه شد. ادعاهای محصول و پذیرش همچنان به گوگل منتسباند و AI News of Today مدل را برای این گزارش آزمایش نکرده است.
تا جای ممکن به اسناد اصلی و گزارشهای دست اول پیوند میدهیم.