把“生成视频”变成“编辑视频”

8 月 27 日,Google DeepMind 发布面向开发者的视频生成模型 Gemini Omni 1.1 Flash。相比初代 Omni 只能参考最后 1 秒画面,1.1 版本可以分析最长 10 秒的上下文:给一段视频,模型能理解前情并续写接下来的场景,每次续写 +10 秒,累计最多 40 秒。

控制能力是这次升级的重点:用户可以指定首尾帧,让视频在规定的起止画面之间生成;也可以引用最长 3 秒的参考视频来保持角色与场景的一致性。Google 称该模型目前在 LMArena 文生视频榜单上排名第一。

  • 新增 360p 草稿模式:生成速度快约 60%,成本约为 720p 的 1/3,适合先快速看效果
  • 草稿满意后可无损升级到 720p、1080p 甚至 4K
  • 通过 Gemini API 在 Google AI Studio 中可用
  • 计费按视频秒数:360p 每秒 0.03 美元、720p 0.10 美元、1080p 0.15 美元、4K 0.30 美元
低分辨率草稿 + 首尾帧约束,指向的是同一个需求:开发者不想一次次抽卡,而是想要能控制的生成。