Gemini Omni Flash؛ مدلی که میتواند از هر نوع ورودی، هر نوع محتوایی تولید کند.
سال گذشته گوگل با معرفی Nano Banana، هوش و توانمندیهای Gemini را به دنیای تولید و ویرایش تصویر آورد. از آن زمان تاکنون، میلیونها کاربر از این فناوری برای ترمیم عکسهای قدیمی، طراحی بر اساس طرحهای اولیه و تبدیل ایدههای ذهنی خود به تصاویر واقعی استفاده کردهاند؛ کارهایی که پیش از این بهسادگی امکانپذیر نبود.
از همان ابتدا، Gemini بهعنوان یک مدل چندرسانهای طراحی شد؛ مدلی که بتواند انواع مختلف دادهها را بهصورت بومی درک و پردازش کند. اکنون گوگل گام مهم دیگری در همین مسیر برداشته است.
گوگل امروز از Gemini Omni رونمایی میکند؛ مدلی که توانایی استدلال و تحلیل Gemini را با قابلیت تولید محتوا ترکیب کرده است. Omni نسل جدیدی از مدلهای هوش مصنوعی گوگل است که میتواند از هر ورودی، هر نوع محتوایی تولید کند و این مسیر را با تولید ویدئو آغاز کرده.
با Gemini Omni میتوانید متن، تصویر، صدا و ویدئو را بهصورت همزمان بهعنوان داده تحویل بدهید و در مقابل، ویدئوهایی باکیفیت بالا دریافت کنید؛ ویدئوهایی که علاوه بر کیفیت بصری، بر پایه دانش گسترده Gemini از دنیای واقعی ساخته میشوند. همچنین امکان ویرایش و اصلاح ویدئوها تنها از طریق یک گفتوگوی ساده با مدل فراهم شده است و نیازی به ابزارهای پیچیده ویرایش ویدئو نخواهد بود.
همزمان با این معرفی، گوگل نخستین عضو خانواده Omni با نام Gemini Omni Flash را در اختیار کاربران اپلیکیشن Gemini، سرویس Google Flow و YouTube Shorts قرار میدهد. گوگل همچنین اعلام کرده که در آینده، خروجیهای دیگری مانند تولید تصویر و صدا نیز به این خانواده از مدلها اضافه خواهد شد.
در ادامه با مهمترین قابلیتهایی که Gemini Omni را به مدلی متفاوت تبدیل میکنند آشنا میشویم:
ویرایش ویدئو به کمک گفتوگو
Gemini Omni به شما اجازه میدهد تنها با نوشتن درخواستهای ساده، ویدئوهای خود را ویرایش کنید. هر تغییری که ایجاد میکنید، بر اساس ویرایشهای قبلی انجام میشود؛ بنابراین شخصیتها، جزئیات صحنه و حرکتها هماهنگ باقی میمانند و ویدئو روند طبیعی خود را حفظ میکند.
دنیای اطراف خود را دگرگون کنید: میتوانید فقط بخشهای مشخصی را تغییر دهید یا کل صحنه را از نو بسازید. ویدئوی شما به نقطه شروع خلق چیزی تبدیل میشود که هرگز امکان فیلمبرداری آن را بهصورت واقعی نداشتید.
نمونه پرامپت:
«مجسمهای از حباب بساز»
بازآفرینی صحنه، فقط با یک پرامپت: ویدئویی که خودتان ضبط کردهاید را در اختیار Gemini Omni قرار دهید و تنها با یک درخواست ساده، از آن بخواهید اتفاقات داخل صحنه را تغییر دهد. این مدل میتواند روند اتفاقات را ویرایش کند، شخصیتها یا اشیای جدیدی به ویدئو اضافه کند یا یکلحظه عادی را به صحنهای کاملاً متفاوت و غیرمنتظره تبدیل کند.
به این ترتیب، بدون نیاز به فیلمبرداری دوباره یا استفاده از نرمافزارهای پیچیده تدوین، میتوانید تنها از طریق گفتوگو، ویدئوهای خود را به شکلی خلاقانه بازآفرینی و شخصیسازی کنید.
نمونه پرامپت:
«وقتی فرد آینه را لمس میکند، سطح آینه مثل مایعی روان و زیبا موج بردارد و بازوی او نیز به مادهای آینهای و بازتابدهنده تبدیل شود».
ویدئوهای خود را در چند مرحله تکمیل و اصلاح کنید: محیط، زاویه دوربین، سبک بصری یا حتی جزئیات مشخصی از صحنه را تغییر دهید، بدون اینکه انسجام و روایت ویدئوی اصلی از بین برود. هر ویرایش بر پایه تغییرات قبلی انجام میشود و مدل ارتباط میان همه مراحل را حفظ میکند. برای مشاهده روند تکامل ویدئو در هر مرحله، میتوانید تصاویر موجود در اسلایدر را مرور کنید.
ایدههای خود را با تکیه بر دانش گسترده Gemini به واقعیت تبدیل کنید
Gemini Omni فقط صحنههایی واقعگرایانه تولید نمیکند، بلکه درباره اتفاقاتی که باید در ادامه رخ دهند نیز استدلال میکند. این مدل با ترکیب درک شهودی از قوانین فیزیک و دانش گسترده Gemini در زمینههایی مانند تاریخ، علوم و فرهنگ، فاصله میان واقعگرایی بصری و روایتپردازی معنادار را از بین میبرد.
خلق تصاویر و ویدئوهایی با فیزیک دقیقتر: Omni درک بهتری از مفاهیمی مانند گرانش، انرژی جنبشی و دینامیک سیالات دارد. همین موضوع باعث میشود بتواند صحنههایی خلق کند که رفتار اجسام، مایعات و سایر عناصر در آنها طبیعیتر، منطقیتر و نزدیکتر به دنیای واقعی باشد.
نمونه پرامپت:
«یک تیله مرمری که با سرعت روی مسیری به سبک واکنش زنجیرهای حرکت میکند؛ همه چیز در یک نمای پیوسته و روان فیلمبرداری شود».
تلفیق دانش و خلاقیت: Omni با بهرهگیری از دانش گسترده Gemini، میان زبان، تصاویر و مفاهیم ارتباطی عمیق برقرار میکند؛ ارتباطی که بسیار فراتر از تشخیص الگوها یا تقلید از نمونههای موجود است. به همین دلیل، این مدل میتواند محتوایی تولید کند که علاوه بر کیفیت بصری، از نظر مفهوم، منطق و روایت نیز دقیقتر و معنادارتر باشد.
نمونه پرامپت:
«در این ویدئو، برای هر حرف الفبا یک شیء متفاوت نمایش داده شود. برای هر حرف، وسیلهای که نام آن با همان حرف آغاز میشود روی میز قرار داده شود (مثلاً، Capybara برای حرف C، Disco globe برای D و Lava Lamp برای L) هر ۲۶ حرف باید با ۲۶ شیء متفاوت نمایش داده شوند و همزمان، برچسبی شامل حرف مربوطه در پایین تصویر ظاهر شود. در هر لحظه فقط یک شیء و یک برچسب نمایش داده شود. برچسبها باید شبیه نوشتهای با ماژیک مشکی روی تکهای کاغذ باشند که در گوشه پایین سمت چپ تصویر قرار گرفته است. نمایش اشیا با سرعت بالا انجام شود؛ حدود ۹ فریم برای هر شیء با سرعت ۲۴ فریم بر ثانیه. آخرین فریم نیز تکه کاغذی با عبارت "THE END" را نمایش دهد. در تمام مدت ویدئو، موسیقی آرام و ملایمی پخش شود».
تبدیل ایدههای پیچیده به تصاویر قابلفهم: Omni میتواند تنها با دریافت یک توضیح کوتاه، ویدئوهای آموزشی و توضیحی جذابی تولید کند و مفاهیم پیچیده را با استفاده از تصاویر و روایت بصری، به شکلی ساده و قابلدرک نمایش دهد.
نمونه پرامپت:
«یک ویدئوی آموزشی به سبک انیمیشن خمیری (Claymation) درباره فرایند پیچیدگیهای ظاهری پروتئین بساز؛ همه اجزای صحنه از خمیر ساخته شده باشند، هیچ دستی در تصویر دیده نشود، انیمیشن به سبک استاپموشن باشد و مفاهیم علمی بادقت نمایش داده شوند».
تولید ویدئو از هر ترکیبی از ورودیها
از هر نوع مرجعی استفاده کنید: Omni میتواند هر نوع محتوای مرجع، از جمله تصویر، متن، ویدئو یا صدا را دریافت کرده و آنها را در قالب یک خروجی واحد، منسجم و هماهنگ با یکدیگر ترکیب کند. در زمان عرضه، از میان ورودیهای صوتی، تنها نمونههای صوتی (Voice References) پشتیبانی خواهند شد، اما گوگل اعلام کرده است که سایر انواع ورودیهای صوتی نیز بهزودی به این قابلیت اضافه میشوند.
نمونه پرامپت:
«بر اساس تصویر image_0.png، یک ویدئو با حالوهوای پویا و علمیتخیلی تولید کن. عناصر صحنه مشابه ویدئوی video_0.mp4 و هماهنگ با ضربآهنگ موسیقی موجود در فایل audio_0.wav روشن شوند».
از همان چیزی که در اختیار دارید شروع کنید: با استفاده از محتوای مرجع، میتوانید تصاویر شخصیتها، صحنهها یا حتی طرحهای اولیه را به مدل بدهید تا خروجی نهایی دقیقاً مطابق با ایده و دیدگاه شما تولید شود.
نمونه پرامپت:
« تصور کن هنگام راه رفتن من، دنیای اطراف بهتدریج به فضایی با سبک رتروفیوچریستی (Retro-Futuristic) تبدیل میشود؛ فضایی نوستالژیک و رازآلود، مشابه تصویر شماره ۱. همچنین از فایل صوتی بهعنوان موسیقی پسزمینهای با حالوهوای رتروفیوچریستی استفاده کن. مدت ویدئو: ۱۰ ثانیه».
اعمال سبک، حرکت و جلوههای بصری: با استفاده از تصاویر، ویدئوها یا سایر ورودیهای مرجع، میتوانید سبک بصری دلخواه خود را برای ویدئو تعریف کنید یا تنها با توصیف آن به زبان طبیعی، نتیجه موردنظر را به Omni بسپارید. این مدل با ترکیب هوشمندانه تمام ورودیهای مرجع، ویدئویی یکپارچه، منسجم و هماهنگ تولید میکند.
نمونه پرامپت:
« این ویدئو را طوری ویرایش کن که همه چیز بدون تغییر باقی بماند؛ فقط افکتهای حرکتی متحرکی از اسکیتبرد خارج شوند».
ویدئوهایی با آواتار دیجیتالی خود بسازید
گوگل متعهد است که هوش مصنوعی را بهصورت مسئولانه توسعه دهد و برای محافظت از کاربران و نحوه استفاده از ابزارهای هوش مصنوعی، سیاستها و چارچوبهای مشخصی در نظر گرفته.
در گام نخست، با استفاده از قابلیت Avatars میتوانید ویدئوهایی با صدای خودتان تولید کنید. این قابلیت نسخهای دیجیتالی از شما میسازد تا بتوانید ویدئوهایی ایجاد کنید که هم از نظر ظاهر و هم از نظر صدا، شبیه خودتان باشند.
گوگل همچنین اعلام کرده است که قابلیت ویرایش ویدئو با هدف تغییر صدا و گفتار افراد هنوز در مرحله بررسی و آزمایش قرار دارد تا اطمینان حاصل شود این امکان به شکلی مسئولانه و ایمن در اختیار کاربران قرار میگیرد.
تمام ویدئوهایی که با Gemini Omni تولید میشوند، به واترمارک دیجیتال نامرئی SynthID مجهز هستند. همچنین کاربران میتوانند از طریق اپلیکیشن Gemini ، نسخه Gemini در مرورگر Chrome و سرویس Google Search بهراحتی بررسی کنند که آیا یک ویدئو با Gemini Omni تولید شده است یا خیر.
گوگل همچنین در حال گسترش ابزارهای راستیآزمایی محتوا است تا کاربران بتوانند بهتر تشخیص دهند یک محتوای دیجیتال چگونه ایجاد یا ویرایش شده است.
همین حالا Gemini Omni را امتحان کنید:
گوگل نخستین عضو خانواده Omni با نام Gemini Omni Flash را بهصورت رسمی عرضه کرده است.
تمامی مشترکان طرحهای Google AI Plus ، Proو Ultra در سراسر جهان میتوانند از طریق اپلیکیشن Gemini و Google Flow به Gemini Omni Flash دسترسی داشته باشند.
بهعلاوه، این قابلیت بهصورت رایگان در اختیار کاربران YouTube Shorts و اپلیکیشن YouTube Create نیز قرار میگیرد تا بتوانند از امکانات تولید و ویرایش ویدئو مبتنی بر هوش مصنوعی استفاده کنند.











