Gemini 3.5 Live Translate جدیدترین مدل صوتی گوگل برای ترجمه همزمان است که قابلیت ترجمه مستقیم گفتار به گفتار را با تأخیری بسیار اندک ارائه میدهد و از بیش از ۷۰ زبان دنیا پشتیبانی میکند.
بیست سال پیش، گوگل ترجمه را بهعنوان یکی از نخستین آزمایشهای خود در حوزه یادگیری ماشین آغاز کرد؛ تلاشی که هدف آن تبدیل علم زبان به پلی برای برقراری ارتباط میان انسانها بود. آن آزمایش اولیه، امروز به فناوریای پیشرفته تبدیل شده؛ بهگونهای که هر ماه بیش از یک تریلیون واژه برای میلیاردها کاربر در محصولات مختلف گوگل ترجمه میشود.
گوگل گام بعدی این مسیر را با معرفی Gemini 3.5 Live Translate برداشته؛ جدیدترین مدل صوتی این شرکت که برای ترجمه گفتار به گفتار طراحی شده و امکان برقراری ارتباط میان افراد را بهصورت طبیعی و تقریباً همزمان فراهم میکند.
این مدل به طور خودکار بیش از ۷۰ زبان را تشخیص میدهد و ترجمهای صوتی، روان و طبیعی تولید میکند که لحن، آهنگ گفتار و زیروبمی صدای گوینده را تا حد زیادی حفظ میکند. برخلاف سامانههای ترجمه نوبتی که تا پایان صحبت گوینده منتظر میمانند و سپس ترجمه را ارائه میکنند، Gemini 3.5 Live Translate بهصورت پیوسته ترجمه را تولید میکند. این مدل بین دریافت اطلاعات برای افزایش دقت در ترجمه و ارائه ترجمه فوری برای همگام ماندن با گوینده تعادل برقرار میکند و ترجمهای روان و طبیعی را رقم می زند. خروجی، ترجمهای صوتی و بدون مکثهای آزاردهنده است که در تمام طول مکالمه تنها چند ثانیه از گوینده عقبتر باقی میماند.
گوگل عرضه Gemini 3.5 Live Translate را در محصولات خود آغاز کرده:
- برای توسعهدهندگان: در قالب پیشنمایش عمومی (Public Preview) از طریق Gemini Live API و Google AI Studio.
- برای سازمانها و کسبوکارها: در قالب پیشنمایش خصوصی (Private Preview) از همین ماه در Google Meet.
- برای عموم کاربران: از طریق اپلیکیشن Google Translate در سیستمعاملهای Android و iOS.
توسعه با Gemini 3.5 Live Translate
Gemini 3.5 Live Translate گفتار را همزمان با دریافت و بهصورت زنده (Streaming) پردازش میکند؛ قابلیتی که برقراری ارتباط میان افراد با زبانهای مختلف را روانتر و طبیعیتر میسازد. این مدل بدون نیاز به تنظیمات دستی، ورودیهای چندزبانه را به طور خودکار تشخیص داده و پردازش میکند.
ازسویدیگر، مقاومت بالای آن در برابر نویز و صداهای مزاحم باعث میشود حتی در محیطهای شلوغ و غیر قابل پیشبینی نیز عملکرد قابل اعتمادی داشته باشد. به همین دلیل، توسعهدهندگان میتوانند از قابلیتهای این مدل برای ارائه ترجمه و تفسیر همزمان در تماسهای چندزبانه، جلسات کاری، کلاسهای آموزشی، پخش زنده رویدادها و بسیاری از کاربردهای دیگر بهره ببرند.
برای مشاهده قابلیتهای Gemini Live API در عمل، میتوانید دموی دوبله و ترجمه همزمان چندزبانه را مشاهده کنید یا نمونه کدهای بیشتر را در Gemini Cookbook بررسی کنید.
با بهرهگیری از Gemini Live API، پلتفرمهای توسعهای مانند Agora، Fishjam، LiveKit، Pipecat و Vision Agents این امکان را برای توسعهدهندگان فراهم کردهاند تا برنامههای مبتنی بر ترجمه صوتی را بهسادگی طراحی، توسعه و مستقر کنند. این پلتفرمها مدیریت زیرساخت پیچیده پردازش و انتقال در لحظه ی رسانه را بر عهده میگیرند تا توسعهدهندگان بتوانند تمرکز خود را بر طراحی تجربه کاربری و توسعه قابلیتهای محصول معطوف کنند.
گوگل همچنین اعلام کرده که شرکت Grab در حال آزمایش این مدل برای برقراری ارتباط چندزبانه و تقریباً همزمان میان رانندگان و مسافران هنگام محل سوار شدن است. کاربران این سرویس هر ماه بیش از ۱۰ میلیون تماس صوتی از طریق پلتفرم Grab برقرار میکنند و این فناوری میتواند نقش مهمی در رفع موانع زبانی و بهبود کیفیت ارتباطات ایفا کند.
بازخوردهای اولیه
علاوه بر Grab، شرکتهایی مانند CJ ENM، LiveKit و چندین شرکت دیگر نیز ارزیابیهای اولیه مثبتی از Gemini 3.5 Live Translate منتشر کردهاند. به گفته این شرکتها، مهمترین نقاط قوت این مدل شامل کیفیت بالای ترجمه، دقت قابل توجه و تأخیر بسیار کم در ترجمه زنده است؛ ویژگیهایی که آن را به گزینهای مناسب برای کاربردهای در لحظه، از جمله تماسهای صوتی، جلسات آنلاین و ارتباطات چندزبانه تبدیل میکند.
تجربه Gemini 3.5 Live Translate در جلسات ویدئویی
بهزودی قابلیت ترجمه گفتار از طریق Gemini 3.5 Live Translate در Google Meet استفاده خواهد شد؛ ارتقایی که تجربه برگزاری جلسات چندزبانه را به شکل قابل توجهی بهبود میبخشد. مهمترین تغییرات این نسخه عبارتاند از:
پشتیبانی از بیش از ۷۰ زبان؛ درحالیکه نسخه پیشین تنها از پنج زبان پشتیبانی میکرد. امکان برقراری مکالمه در بیش از ۲ هزار ترکیب زبانی در یک جلسه؛ قابلیتی که محدودیت ترجمه صرفاً به زبان انگلیسی و از انگلیسی را برطرف میکند. بازطراحی رابط کاربری برای فراهم کردن دسترسی سریع و آنی به قابلیت ترجمه زنده گفتار.
گوگل اعلام کرده است که این قابلیت از همین ماه در قالب پیشنمایش خصوصی برای گروهی از مشتریان سازمانی Google Workspace عرضه میشود و سپس در ادامه سال جاری بهصورت گستردهتر در دسترس سایر کاربران قرار خواهد گرفت.
تجربه Gemini 3.5 Live Translate در اپلیکیشن Google Translate
گوگل Gemini 3.5 Live Translate را در اپلیکیشن Google Translate برای سیستمعاملهای Android و iOS بهصورت جهانی عرضه میکند. کاربران با استفاده از قابلیت Live Translate و اتصال هر نوع هدفون، میتوانند ترجمهای روانتر و طبیعیتر را تجربه کنند؛ ترجمهای که لحن، آهنگ و سبک گفتار گوینده را در بیش از ۷۰ زبان حفظ میکند.
علاوه بر این، گوگل برای کاربران اندروید بهتدریج قابلیت جدیدی با نام Listening Mode را ارائه میکند که بر پایه Gemini 3.5 Live Translate توسعه یافته. این قابلیت امکان شنیدن ترجمه را مستقیماً از طریق بلندگوی مکالمه ی گوشی فراهم میکند. کافی است مانند یک تماس تلفنی معمولی، گوشی را کنار گوش خود نگه دارید تا صدای ترجمهشده بهصورت مستقیم برای شما پخش شود.
این ویژگی در موقعیتهایی که میخواهید ترجمه را بهسرعت و بهصورت خصوصی بشنوید، بدون آنکه دیگران صدای آن را بشنوند یا هدفون در اختیار داشته باشید، کاربردی و کارآمد خواهد بود.
نشانهگذاری دیجیتال با SynthID
تمام فایلهای صوتی تولیدشده توسط مدلهای گوگل با فناوری SynthID بهصورت دیجیتالی واترمارکگذاری (Watermark) میشوند. این واترمارک داخل فایل صوتی قرار میگیرد، اما با گوش قابل تشخیص نیست. هدف از این کار این است که بعداً بتوان تشخیص داد صدا با هوش مصنوعی ساخته شده است و از انتشار اطلاعات نادرست جلوگیری شود.
گوگل اعلام کرده که جزئیات مربوط به رویکرد این شرکت در زمینه ایمنی، مسئولیتپذیری و سازوکارهای حفاظتی این مدل در Model Card آن منتشر شده است.











