该系统将扩散 Transformer 重构为一种循环式、分块自回归过程,具备近乎恒定内存的注意力机制。它结合因果线性注意力、可学习注意力头剪枝、采样步蒸馏和面向内存优化的 VAE 解码,使大型视频模型能够在可接受的移动延迟预算内生成短竖屏视频。
MobileWan 适合探索本地视频生成、隐私友好型移动媒体创作以及高效扩散部署的研究人员和产品团队。项目报告其可在约 20 秒内生成 5 秒、480x832、16 FPS 的视频,VBench 得分为 83.79,并在用户研究中优于更早的移动视频生成基线。

