关键功能

将 5B 参数规模的 Wan2.2 视频扩散模型适配到移动端部署。
使用循环蒸馏按块生成视频,并保持近乎恒定的内存占用。
将因果线性注意力与类似 Transformer-to-RNN 的推理行为结合。
应用带二值门控和稀疏正则的可学习注意力头剪枝。
使用采样步蒸馏减少扩散步数。
为内存受限设备优化了 VAE 解码。
可在约 20 秒延迟下生成 5 秒、480x832、16 FPS 视频。
在移动视频扩散方法中报告了最先进的 VBench 结果。

该系统将扩散 Transformer 重构为一种循环式、分块自回归过程,具备近乎恒定内存的注意力机制。它结合因果线性注意力、可学习注意力头剪枝、采样步蒸馏和面向内存优化的 VAE 解码,使大型视频模型能够在可接受的移动延迟预算内生成短竖屏视频。


MobileWan 适合探索本地视频生成、隐私友好型移动媒体创作以及高效扩散部署的研究人员和产品团队。项目报告其可在约 20 秒内生成 5 秒、480x832、16 FPS 的视频,VBench 得分为 83.79,并在用户研究中优于更早的移动视频生成基线。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!