# Google DeepMind 发布 Gemini Omni 多模态模型

去年,Nano Banana 将 Gemini 的智能引入了图像生成和编辑领域。自那时起,它已帮助数百万人修复旧照片、从草图进行设计,并以以往无法实现的方式将创意可视化。从一开始,我们就将 Gemini 构建为原生多模态模型,现在我们正在迈出下一步。

我们推出了 Gemini Omni,将 Gemini 的推理能力与创造能力相结合。Omni 是我们的新模型,能够从任何输入(首先从视频开始)创建任何内容。通过 Omni,您可以结合图像、音频、视频和文本作为输入,并生成基于 Gemini 现实世界知识的高质量视频。您还可以通过对话轻松编辑视频。

今天,我们正在向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列的首个模型:Gemini Omni Flash。未来,我们将支持图像和音频等输出模态。以下是 Omni 的独特之处:

通过对话编辑视频

Gemini Omni 为您提供了一种更简单的视频编辑方式——使用自然语言。每一条指令都建立在前一条指令的基础上。您的角色保持一致,物理规律保持不变,场景也能记住之前发生的内容。

改变您周围的世界。改变特定的事物,或者改变一切。您的视频将成为您自己无法拍摄出的内容的起点。

  • 提示词:把雕塑变成气泡做的。
  • 提示词:当人触摸镜子时,让镜子像液体一样美丽地荡漾,人的手臂变成反射性的镜面材料。
  • 提示词:调暗房间的灯光。在一个漂浮在手上方并追踪手部动作的玻璃球内放置一个黑白棋盘格房间,球内包含同一个手握住球的递归表现,创造出一个无限递归的房间。摄像机缓慢靠近球体,形成一个视频循环。
  • 提示词:公寓的灯光开始随着音乐同步亮起。

通过多轮对话优化您的视频。改变环境、角度、风格甚至特定细节,而不会丢失原始场景的线索。

  • 提示词:一段小提琴手演奏歌曲的视频。
  • 提示词:将小提琴手传送到图像环境。
  • 提示词:让小提琴隐形。
  • 提示词:将摄像机角度改为小提琴手的肩后视角。

基于 Gemini 的世界知识实现创意

Gemini Omni 不仅能构建看起来真实的场景,还能推理接下来应该发生什么。它将对物理学的直观理解与 Gemini 在历史、科学和文化背景方面的知识相结合,弥合了从照片级真实感向有意义的故事讲述之间的鸿沟。

创建物理效果更准确的视觉内容。Omni 对重力、动能和流体动力学等力学有更深入的直观理解,使您能够创建更逼真的场景。

  • 提示词:一个在连锁反应式轨道上快速滚动的弹珠,连续平滑的镜头。

融合知识与创造力。Omni 利用 Gemini 的知识,以远超模式匹配的方式连接语言、图像和意义。

  • 提示词:视频展示了字母表中的项目。每个字母开头的不同寻常的项目都放在桌子上(例如 C 代表水豚,D 代表迪斯科球,L 代表熔岩灯)。所有 26 个字母必须由 26 个项目表示,并配有显示字母的匹配下三分之一字幕。一次只显示一个项目和下三分之一字幕。每个下三分之一字幕看起来必须像左下角纸条上用黑色记号笔书写的字。快速切换,24FPS 下每个项目大约 9 帧。最后一帧是一张写着“THE END”的纸条。整个视频伴随着平静平滑的音乐。

将复杂想法可视化。Omni 可以通过简短的提示词创建引人注目的解释性视频,生成分解复杂想法的视觉内容。

  • 提示词:蛋白质折叠的粘土动画解释,一切都是用粘土制作的,没有手,定格动画,准确。

从任何输入组合创建视频

参考任何内容。Omni 将任何参考资料——图像、文本、视频或音频——转化为单一的、连贯的输出。虽然目前音频输入仅支持语音参考,但我们很快将推出其他类型的音频输入。

  • 提示词:基于 image_0.png 的动态科幻电影风格视频。元素亮起的方式类似于 video_0.mp4,并与 audio_0.wav 的音乐节拍同步。
  • 提示词:参考 video-0 中的极端摄像机运动、透视和畸变,创建 image-0 中角色的正面全身行走循环,在行走循环中快速切换多种视觉风格,从写实电影风格开始。保持环境不变,只改变风格。硬切背景,始终以天空为中心。连续行走,连续音频,风格切换与音频节拍完美同步。电影感,16:9。
  • 提示词:添加与我触摸每片蕨类植物叶子时同步的竖琴声。将叶子结构全部改变为类似于半透明的 3D 生物发光植物,周围有生物发光萤火虫,它们随着我的演奏而反应,与声音同步,微妙的焦外成像景深动态照明,反射在房间墙壁上,保持房间结构不变。

从您现有的内容开始。通过输入参考,您可以使用角色、场景或绘图的图像,以符合您愿景的方式进行创作。

  • 提示词:想象当我行走时,世界逐渐变成复古未来主义风格(颗粒感和情绪化,如 image-1)。使用音频作为复古未来主义背景音乐。10秒。
  • 提示词:将其转换为写实镜头,仅将绘图作为运动指南,最终视频中不要显示绘图。
  • 提示词:将输入视频中的姿势和动作应用到此图像提供的角色上。将图像参考中的风格应用到新视频中。

应用风格、运动或效果。通过使用输入参考来定义视觉语言,或者直接用自然语言描述它。Omni 混合输入参考以创建连贯的剪辑。

  • 提示词:编辑此视频,保持一切不变。添加从滑板中出来的动画运动效果。
  • 提示词:将所提供视频中鲸鱼游泳的动作应用到所提供的流体反射材料图像上。不要显示鲸鱼或水;相反,让这种反射性的移动材料形成类似于鲸鱼游泳时的形状。用移动的白色光滑材料形状代替水。

使用您的数字头像创建视频

我们致力于负责任地开发人工智能,并制定了明确的政策来保护用户免受伤害,并规范我们人工智能工具的使用。首先,您可以使用头像创建带有您自己声音的视频,这些头像会创建您的数字版本,以便您可以生成看起来和听起来像您的视频。除了头像功能外,在编辑视频以更改音频和语音方面,我们仍在努力进行测试,并更好地了解如何以负责任的方式为用户提供此功能。

所有使用 Omni 创建的视频都包含我们不可见的 SynthID 数字水印。您可以通过 Gemini 应用、Chrome 中的 Gemini 和 Google 搜索轻松验证视频是否由 Gemini Omni 生成。


来源:Google DeepMind|原文链接