昊梵体育网

张吕敏团队新作:轨迹可控视频合成

把产品图、角色动画或特效素材放进另一段视频,难点不只是“贴进去”:既要保留素材原本的身份和动作,又要让它严格沿指定路线移动,还得适应新场景的遮挡、光照与阴影。

现有生成式方法往往顾此失彼——控制精确时像贴纸,融合自然时又容易改坏原动作。

港科大、浙大、港中文和斯坦福团队提出 FlexComposer,把静态图片与动态视频统一为“轨迹引导的视频合成”任务。项目页将论文标注为 ECCV 2026 Accepted Paper。

核心设计有三点:
- Canonical Foreground:先把动态主体稳定到画面中心,将“角色自己的动作”与“整体位移”分开;静态图则扩展成序列并加入时间噪声,让模型生成微动作。
- Spatial-Aware Latent Injection:将前景的 VAE 特征逐帧搬运到目标轨迹,不需要额外的轨迹适配器;Visibility Gate 控制主体何时出现、何时被遮挡。
- Synthetic-to-Real Curriculum:依次使用 1.2 万条合成视频、5.4 万条真实视频和约 5000 条生成视频,分别学习几何控制、真实光影和开放类别泛化。

在作者实验中,FlexComposer 的 DAVIS V2V 轨迹误差 EPE 为 2.15,动态合成 FVD 为 468.30,均优于列出的基线;消融实验中去掉 Latent Transport 后,EPE 从 2.39 上升到 5.68。

它真正解决的是“素材动作”和“全局路径”的解耦,适合做广告素材植入、角色合成、特效迁移和可控视频编辑。

推荐视频生成、AIGC 工具和 VFX 方向重点关注,论文给大家上传附件啦~需要自取!