Masked Visual Actions

热门

关键功能

使用遮罩视觉动作进行统一机器人世界建模。
支持从动作表示到视频的前向建模。
支持恢复动作相关结构的逆向建模。
使用渲染的机器人控制视频作为视觉条件信号。
可在生成工作流中结合参考图像和文本提示。
评测了未见夹爪和未见机器人形态。
链接到公开代码,支持微调和推理。
包含展示机器人控制对比的直接 MP4 视频。

该方法使用渲染控制视频、参考图像和提示,生成对应的真实世界机器人视频行为。项目示例包括 DROID 训练域案例、未见夹爪、未见机器人形态,以及与基线控制表示的比较。


Masked Visual Actions 适用于机器人研究者、世界模型开发者以及构建动作条件视频预测系统的团队。它通过让动作信息变得可见且可迁移,在机器人控制信号与生成式视频模型之间建立了实用桥梁。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!