关键功能

将预训练视频生成模型转化为通用视觉学习器。
在同一架构中支持文本驱动的稠密和稀疏感知任务。
可处理深度、表面法线、相机位姿、分割和关键点类任务。
在视频扩散骨干上进行多任务后训练。
作为前馈模型运行,而不是迭代式生成流水线。
大量使用合成数据,同时展示了 sim-to-real 迁移能力。
相较专用模型报告了有竞争力或最先进的性能。
展示了在未见物体、动物、多人物场景和 3D 理解上的涌现行为。

该方法从视频生成扩散骨干出发,主要借助合成数据进行多任务后训练。稠密任务在 RGB 环境空间中表示,而稀疏任务则向扩散 Transformer 中加入可学习 token,使模型能够在一次前向传播中完成多个视觉推理任务。


GenCeption 适合探索通用计算机视觉的研究人员,以及希望用一个视觉模型泛化多种任务而不是维护一组专用模型的团队。项目报告了强劲的最先进对比结果、良好的数据效率、从仿真到真实的迁移能力,以及在分布外类别上的涌现行为。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!