谷歌推出全新多模态模型 Omni

去年,我通过深度伪造技术让孩子的毛绒鹿玩偶“去度假”了。这是一个实验,旨在重现谷歌 Gemini 广告中的场景。虽然我从未给四岁的孩子看过这些视频,但这次经历让我深刻思考了生成式 AI 带来的乐趣与潜在问题。如今,这种趋势在 Gemini 的 Omni 时代得到了延续。

Omni 是一个全新的生成式模型系列,据称未来能够将任何类型的输入(照片、视频、文本)转换为任何其他形式。目前,它主要用于视频创作。Omni Flash 是谷歌发布的首个此类模型,现已集成在谷歌的 AI 视频生成与编辑平台 Flow 中。虽然你仍可以使用之前的模型 Veo,但 Omni 在多个方面进行了改进。

Omni 的实际表现与局限性

使用 Omni,你可以上传视频并结合文本提示作为 AI 生成创作的起点。谷歌声称,Omni 在生成视频时融入了更多现实世界的知识,因此在保持角色一致性方面表现更好。为了验证这一点,我再次让 AI 版的 Buddy 玩偶打包行李去冒险。

结果令人困惑。有些片段非常出色,比我五个月前测试 Veo 时更符合提示词。但即使是最好的片段,依然存在 AI 常见的“惊悚瞬间”,比如 Buddy 在跳伞时突然改变方向。

在另一个视频中,我给了 Omni 一些艺术创作自由。它让 Buddy 打包了一罐蜂蜜,随后在视频中,他伸手去拿蜂蜜,动作却像是在涂防晒霜。尴尬的是,蜂蜜瓶在视频中不断变换形态,从罐子变成透明挤压瓶,又变回蜂蜜瓶。此外,视频的最后一帧简直是一团混乱。

你可以使用基于文本的提示来建议视频编辑,Omni 在这方面的表现确实优于 Veo。但结果依然不够稳定。我曾要求它强调 Buddy 在度假片段中的面部表情,结果却显得很奇怪。它还会时不时给 Buddy 加上他本没有的鹿角。当我要求移除鹿角时,它照做了,却又在其他场景中加上了鹿角。

此外,这一切并非免费。生成视频需要消耗积分,根据场景长度和初始素材,每次消耗 15 到 40 积分不等。我每月支付 20 美元的 AI Pro 计划包含 1,000 积分,但在生成约 20 个片段并进行少量编辑后,积分已所剩无几。

深度伪造的逼真度与伦理隐忧

Omni 的一大优势是将 AI 生成的内容添加到真实视频中。我尝试对自己进行深度伪造:从一段表情中性的自拍视频出发,我让 Omni 生成我吃意大利面、坐在飞机座位上以及在埃菲尔铁塔前吃法棍的视频。看到结果时,我确实感到震惊。

虽然视频中存在一些 AI 的痕迹,比如叉子敲击碗的声音过于人工化,或者背景中出现重复的人物,但抛开这些小瑕疵,它们极其逼真。我向丈夫展示了吃意大利面的片段,他完全相信那是真的,唯一的疑惑只是碗看起来很陌生。对于一个每天看我的人来说,这足以证明其逼真程度。

其他深度伪造视频也达到了“足以欺骗社交媒体用户”的水平。虽然有些片段略显卡通,但其中一些足以让人反复观看才能辨别出是 AI 生成的。我知道当 AI 版的我转头露出马尾辫时那不是我,但我不敢确定其他人能否分辨出来,这让我感到不安。

我对此感到有些疲惫。我曾对 Veo 3 的逼真度感到震惊,也曾多次对伪造照片的简易性感到惊讶。虽然 Omni 确实在某些方面有所改进,但它离谷歌所宣称的“电影级杰作”还有距离。如果你有谷歌账号和信用卡,只需极小的努力,就能把自己坐在家里的视频变成在飞往毛伊岛的航班上。我们或许还没到达“奇点”,但绝对已经深陷“恐怖谷”之中。

![](url)


来源:The Verge AI|原文链接