该方法向预训练视频扩散 Transformer 注入可学习的规划 token,并为其分配带小数时间位置的 RoPE 编码。这些 token 会在去噪过程中引导模型朝目标转场事件收敛,随后在解码前被移除,因此输出形状和推理开销仍与基础模型保持一致。
ShotPlan 适合需要通过单条提示实现多镜头结构的 AI 电影创作者、视频生成研究者和工具开发者。它有助于生成具备帧级精确切换、交叉淡化、局部相机运动以及更连贯叙事节奏的视频。
该方法向预训练视频扩散 Transformer 注入可学习的规划 token,并为其分配带小数时间位置的 RoPE 编码。这些 token 会在去噪过程中引导模型朝目标转场事件收敛,随后在解码前被移除,因此输出形状和推理开销仍与基础模型保持一致。
ShotPlan 适合需要通过单条提示实现多镜头结构的 AI 电影创作者、视频生成研究者和工具开发者。它有助于生成具备帧级精确切换、交叉淡化、局部相机运动以及更连贯叙事节奏的视频。
在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!


Get top updates in AI to your inbox every weekend. It's free!