寻找最新最佳的3D人工智能。浏览最全面的AI数据库,每日持续更新。
最新
LUNA 是一种无需 LBS 的通用神经动画模型,可从少量身份图像和多样化 2D 驱动信号中创建逼真、可动画化的 3D 人体头像。它将图像、关键点、草图和未见角色输入映射为 3D 高斯表示的形变,而无需显式人体拟合。
该系统首先从四张未摆姿态的多视角身份图像中重建规范 3D 高斯。随后,基于 Transformer 的隐式神经动画
PhysiFormer 是一种用于生成物理合理 3D 物体运动的扩散 Transformer。给定每个顶点的初始位置、速度以及物体材料类型,它会在世界坐标中采样完整时域的顶点轨迹,使模型能够在不依赖视角相关像素空间的情况下推理刚体、弹性体和混合材料的交互。
该模型将轨迹预测表述为网格坐标上的去噪扩散过程。跨时间、空间和物体的因式分
Lift4D 是一种测试时优化框架,用于从单目野外视频中重建完整的动态 4D 物体。它旨在恢复几何、外观和形变,包括相机从未直接观测到的区域。
该方法会调整单视图 3D 重建模型,通过因果潜变量条件生成时间一致的逐帧 3D 预测。这些预测用于初始化可变形的 3D Gaussian Splatting 表示,随后再通过感知遮挡的外观
Arbor 3D 是一种使用显式几何条件控制的 3D 资产生成方法。它引入约束网格作为原生控制接口,用于告诉文本条件 3D 生成器几何体应出现在哪里、哪些区域应保持为空,以及应接触哪些表面。
该方法在保持文本条件生成器和几何编码器冻结的同时,训练几何投影、位置嵌入、摘要模块和 grounding 适配器。Hull、avoidanc
LOGOS,科学生成对象语言,是一个建立在统一科学语法之上的多领域科学生成框架。它将蛋白质、抗体、小分子、反应、材料和空间相互作用编码为共享词汇中的标记序列。
与使用自然语言作为中介或需要显式 3D 几何网络的系统不同,LOGOS 在域本机表示上运行。诸如蛋白质口袋-配体接触之类的空间关系被离散化和标记化,因此一种自回归模型可以
OmniDirector 是一个相机运动克隆系统,用于对参考视频中的源图像进行动画处理,包括多镜头相机运动,无需交叉配对训练数据。它的目标是动态摄像机运动、多镜头过渡、场景概括和特殊摄像机技术。
该方法通过根据空 3D 空间中的参考摄像机姿势渲染的摄像机网格来表示摄像机运动。在训练期间,该相机网格与其他控件一起注入到 MMDiT
Surflo 是一种流匹配方法,用于从数量可变、无需位姿的图像中重建连贯的 3D 表面。它将所有输入视角融合为固定的全局潜状态,再以任意分辨率解码显式定向表面点。
系统采用基于 VGGT 的编码器、Perceiver 风格压缩器来生成全局状态,并通过逐点流匹配 ODE 解码。它加入基于渲染的通信引导,使独立流动的点仍属于同一个连贯
MoVerse 是一种实时视频世界建模方法,可从单张窄视场图像构建可导航的 3D 世界。它将世界构建与观察渲染分离,使可复用的全景高斯骨架能够支持交互式视频漫游。
该流程先把输入图像扩展为重力对齐的 360 度全景图,再将其提升为 3D 高斯骨架,随后沿用户控制的相机轨迹渲染逼真的视频。项目页面报告在单张 RTX 4090 上可实
VideoMDM 是一个基于扩散的框架,可在 2D 监督下生成 3D 人体动作。它直接从单目视频中提取的精确 2D 姿态学习 3D 人体动作先验,从而避免训练时依赖真实 3D 动作捕捉真值。
该方法使用预训练的 2D 到 3D 提升器作为带噪教师,对提升结果进行扩散,并通过 2D 重投影损失监督去噪。页面介绍了深度加权重投影、速度
MeshFlow 是一种高效的艺术化网格生成方法,将 MeshVAE 与基于流的扩散 Transformer 结合起来。它在连续潜空间中生成显式网格几何和连接关系,而不是通过自回归方式逐个解码离散面片 token。
该方法先将网格压缩为紧凑的连续潜变量,再通过流匹配并行生成。页面强调约一秒生成速度、相较于自回归风格网格生成约 18
AnchorWorld 是一个具身第一人称世界模拟框架,支持基于视图的演化定制。它利用人体动作控制和与姿态关联的锚点视图,让智能体或玩家能够以第一人称视角探索定制化世界。
每个锚点视图都提供 RGB 图像、用于空间定位的 3D 姿态,以及说明场景应如何变化的演化提示。该方法结合了混合视角的人体动作控制、可演化的锚点视图定制和渐进式
World Tracing 是一种像素对齐的生成式几何方法,用于预测可见表面之外的分层 3D 世界。它可以从单张图像或短时动态输入中估计物体、场景和运动内容的多层几何,而不只是最前方可见的深度。
项目页面展示了物体、场景和动态预测器,并提供 6 层物体与场景几何模型以及 16 帧动态模型的链接。它支持免训练的纹理网格生成、3D 场
Actionable World Representation 通过 WorldString 展示,是一种用于构建物理对象神经数字孪生的方法。它从关键点条件 3D 建模中学习 token 分配和误差图,使对象几何能够真正用于机器人和仿真场景中的操作。
该项目面向关节式、蒙皮式、柔性、可变形以及机器人对象,页面展示了机器人手、SMP
PanoWorld 是一种生成空间世界模型,旨在根据平面图和风格参考对 VR 风格的游览进行一致的全屋全景合成。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 PanoWorld 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的
LiTo 是一种表面光场标记化方法,专为具有依赖于视图的外观的高质量图像到 3D 生成和重建而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 LiTo 不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
Pantheon360是一种3D感知的360度视频扩散模型,专为数字孪生生成而设计,具有全景覆盖、精确的摄像机控制和时空一致性。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Pantheon360 并不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能
PhysX-Omni 是一个统一的模拟就绪物理 3D 生成框架,旨在生成具有物理属性的刚性、可变形和铰接的 3D 资产。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 PhysX-Omni 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生成或 A
CubePart 是一种开放词汇的零件可控 3D 生成器,设计用于根据文本提示和零件架构创建多零件 3D 网格对象。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 CubePart 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生成或 AI 分析
TriSplat 是一种前馈 3D 场景重建方法,旨在从稀疏视图生成可用于仿真的网格状场景重建。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 TriSplat 不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
GenRecon 是一个多视图 3D 场景重建框架,旨在从休闲智能手机视频或多视图 RGB 图像生成完整的可编辑 PBR 就绪室内场景网格。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 GenRecon 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人