关键功能

可在用户指定的帧位置控制硬切。
支持交叉淡化等柔性转场。
可在视频中精确触发相机运动。
使用注入视频扩散 Transformer 的可学习规划 token。
应用 Fractional Temporal RoPE 实现潜空间中的帧级时间控制。
在解码前移除规划 token,避免额外输出开销。
构建于 Wan 视频扩散模型工作流之上。
提供公开代码、模型、数据集和论文链接。

该方法向预训练视频扩散 Transformer 注入可学习的规划 token,并为其分配带小数时间位置的 RoPE 编码。这些 token 会在去噪过程中引导模型朝目标转场事件收敛,随后在解码前被移除,因此输出形状和推理开销仍与基础模型保持一致。


ShotPlan 适合需要通过单条提示实现多镜头结构的 AI 电影创作者、视频生成研究者和工具开发者。它有助于生成具备帧级精确切换、交叉淡化、局部相机运动以及更连贯叙事节奏的视频。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!