让视频智能体从人类电影里学习

阿里团队在 arXiv(2608.12313)发布 AVA-Encoder(Agentic Video Auto-Encoder),目标是让视频创意智能体学会从高质量人类电影中学习。论文指出,视频创意智能体缺少一种既忠实于影片内容、又可直接用于智能体推理与操作的结构化视频表示,这是它们难以产出电影级画面的关键瓶颈。

方法上,AVA-Encoder 先把视频转换为 Film Knowledge Graph(电影知识图谱)表示,再重建回视频。Film KG 显式记录实体、事件、素材及其多模态关系,智能体可以理解、查询并操作;重建残差驱动一个双循环文本梯度优化框架,联合改进图谱表示与智能体视频编码器。

  • 相比最强外部基线取得 20.7 个百分点的绝对提升(相对提升 73.1%)
  • 受控策略对比中,伪训练出的编码策略优于人工调优策略
  • 镜头级与关键帧级系统提示词 token 分别减少 74.3% 与 70.1%
  • 知识图谱支持可控链接编辑:修改角色身份或视觉风格可自动传播到相关镜头并保持语义一致

团队同步开源完整框架、智能体视频重建基准与首个大规模故事视频知识图谱数据集,并验证该表示能有效提升多个下游创意智能体视频生成框架的故事视频质量。

把「重建忠实度」当作智能体视频表示的学习目标,非结构化视频到结构化图谱的映射才算真正可操作。