该方法从视频生成扩散骨干出发,主要借助合成数据进行多任务后训练。稠密任务在 RGB 环境空间中表示,而稀疏任务则向扩散 Transformer 中加入可学习 token,使模型能够在一次前向传播中完成多个视觉推理任务。
GenCeption 适合探索通用计算机视觉的研究人员,以及希望用一个视觉模型泛化多种任务而不是维护一组专用模型的团队。项目报告了强劲的最先进对比结果、良好的数据效率、从仿真到真实的迁移能力,以及在分布外类别上的涌现行为。
该方法从视频生成扩散骨干出发,主要借助合成数据进行多任务后训练。稠密任务在 RGB 环境空间中表示,而稀疏任务则向扩散 Transformer 中加入可学习 token,使模型能够在一次前向传播中完成多个视觉推理任务。
GenCeption 适合探索通用计算机视觉的研究人员,以及希望用一个视觉模型泛化多种任务而不是维护一组专用模型的团队。项目报告了强劲的最先进对比结果、良好的数据效率、从仿真到真实的迁移能力,以及在分布外类别上的涌现行为。
在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!


Get top updates in AI to your inbox every weekend. It's free!