گوگل در ۹ ژوئن Gemini 3.5 Live Translate را بهعنوان سامانه ترجمه صوتی پیوسته معرفی کرد. شرکت گفت این محصول بیش از ۷۰ زبان را خودکار تشخیص میدهد و میتواند بیش از ۲ هزار ترکیب زبانی را در یک جلسه پوشش دهد. طراحی آن بهگونهای است که گفتوگو بدون انتخاب زبان از سوی هر نفر یا انتظار برای نوبتهای جداگانه و خشک ادامه پیدا کند.
گوگل گفت مدل میکوشد لحن، آهنگ و زیر و بمی صدا را حفظ کند، نه اینکه گفتار را فقط به واژهها تقلیل دهد. این ویژگیها هنگام قطع کردن حرف، مکث یا تأکید معنا حمل میکنند. اعلام رفتار مورد نظر را شرح میدهد، اما دقت یا طبیعی بودن یکسان در همه جفتزبانهای پشتیبانیشده را ثابت نمیکند.
پیشنمایش عمومی از طریق Gemini Live API وGoogle AI Studio آغاز شد. اتصال به Google Translate وGoogle Meet برای آینده اعلام شد، پس دسترسی پیشنمایش با تکمیل عرضه در محصولات مصرفی و کاری گوگل یکی نیست. پیش از پیادهسازی باید قیمت، مناطق و شناسههای مدل را در اسناد فعلی بررسی کرد.
این تغییر برای سفر، جلسه، پشتیبانی مشتری و یادگیری زبان مفید است، زیرا لایه ترجمه هنگام صحبت فعال میماند. همین محیطها محدودیتها را هم آشکارتر میکنند. لهجه، گفتار چندزبانه، صدای همزمان و سروصدای پسزمینه میتوانند بر سامانهای اثر بگذارند که در نمایش تمیز خوب عمل میکند.
تعداد زبان فقط مشخصه آغازین است. مقایسه معنادار به ضبطها، گویندگان و روش امتیازدهی یکسان نیاز دارد و گویندگان بومی باید حفظ لحن و معنا را بسنجند. تا پیش از چنین شواهدی، ادعاهای پوشش و کیفیت گوگل باید به خود شرکت منتسب بمانند، نه اینکه رتبهبندی بهترین مترجم تلقی شوند.
در ادامه چه چیزی مهم است
آزمایش چندزبانه بیرونی و جزئیات تأییدشده عرضه در Google Translate وMeet، مناطق و قیمتها شواهد مفید بعدی خواهند بود.
منابع
این پرونده بازنگرانه عرضه در ۳ اوت ۲۰۲۶ از اعلام گوگل، کارت مدل، اسناد API و گزارش Ars Technica برای زمینه تهیه شد. AI News of Today برای این گزارش آزمایش چندزبانه انجام نداده است.
تا جای ممکن به اسناد اصلی و گزارشهای دست اول پیوند میدهیم.