8 月 27 日,Google DeepMind 发布 Gemini Omni 1.1 Flash。它的定位很明确:不是再发一个「文生视频」模型,而是把视频生成变成可控制的创作流程——先给模型一段上下文,让它接着往下演。

最值得试的三个新能力

第一个是续写。模型可以分析最长 10 秒的前置画面,每次续写 +10 秒,累计最多 40 秒。相比初代 Omni 只能参考最后 1 秒,这个进步是决定性的:同一角色、同一场景的连贯叙事第一次有了可行路径。

第二个是控制。用户可以指定首尾帧,让视频在规定起止画面之间生成;也可以引用最长 3 秒的参考视频来锁定角色长相与场景风格。配合 API 使用,等于把「抽卡式生成」变成了「有约束的生成」。

  • 续写:分析前 10 秒上下文,每次 +10 秒,累计最多 40 秒
  • 控制:支持指定首尾帧、引用最长 3 秒参考视频
  • 草稿:360p 模式速度快约 60%、成本约为 720p 的 1/3
  • 升级:草稿可无损升级 720p/1080p/4K,API 按秒计费

评分与适用人群

给 4.2 分,扣分项主要在价格与门槛:每秒 0.03-0.30 美元按秒计费,意味着一条 30 秒的成片即使只用 720p 也要约 3 美元,重试几次成本就上来了。另外它目前只走 API,普通用户得靠第三方界面才能用上,体验取决于套壳质量。

适合的人群是:做短视频分镜预演的创作者、需要在生成结果上继续编辑的团队、以及把视频生成接进自动化流程的开发者。如果只是偶尔生成一条 5 秒片段,初代 Omni 或其它按次计费的工具可能更划算。

视频生成这一年最大的变化不是画质,而是「能不能让它接着上一段继续」——Omni 1.1 把这条路径走通了。