寻找最新最佳的研究人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Wonder 是一个用于图像和视频条件世界生成的交互式视频世界模型。它能够构建持久环境,用户可通过相机移动进行导航,同时逐步显现未见区域,并以一致的视觉记忆返回先前视角。
该系统结合了稠密控制信号、全保真记忆机制、对历史的稀疏注意力以及校正蒸馏训练策略。其设计目标是在真实、卡通和类游戏世界中保持几何结构、外观、动态以及交互控制的一
PhiZero 是一个围绕物理语言构建的研究型世界模型。物理语言是一种从自然视频中学习到的、对世界状态转移进行紧凑离散表示的方法。它将物理推理与视频渲染分离,使系统能够先推理场景如何演化,再生成视觉输出。
该方法使用物理语言 tokenizer 和物理语言推理器,把视觉经验转换为可复用的转移 token。这使模型能够描述富含运动的
Instella-MoE 是 AMD 完全开放的专家混合语言模型,总参数量为 160 亿,每个 token 激活约 28 亿参数。它在 AMD Instinct MI300X 和 MI325X GPU 上从头训练,是一次透明开放的模型发布。
该发布覆盖完整训练流程,包括预训练、中期训练、长上下文扩展、监督微调、直接偏好优化和强化学
Kimi K3 是 Moonshot AI 面向长上下文推理、智能体编码、知识工作和视觉问题求解的前沿级多模态模型。它被定位为一个拥有 2.8 万亿参数、3T 级别、原生支持视觉且具备 100 万 token 上下文窗口的模型,为团队提供一个可覆盖仓库级开发、重文档分析和多模态工作流的统一模型。
该模型结合了 Kimi Delta
GenCeption 是一个研究模型,它把预训练的视频生成模型重新用于统一的前馈式视觉学习器。它不再为每个感知任务单独训练模型头,而是通过文本指令驱动同一架构完成深度、法线、相机位姿、分割和关键点等稠密与稀疏视觉任务。
该方法从视频生成扩散骨干出发,主要借助合成数据进行多任务后训练。稠密任务在 RGB 环境空间中表示,而稀疏任务则
LUNA 是一种无需 LBS 的通用神经动画模型,可从少量身份图像和多样化 2D 驱动信号中创建逼真、可动画化的 3D 人体头像。它将图像、关键点、草图和未见角色输入映射为 3D 高斯表示的形变,而无需显式人体拟合。
该系统首先从四张未摆姿态的多视角身份图像中重建规范 3D 高斯。随后,基于 Transformer 的隐式神经动画
Arbor 是一个面向自主研究的框架,核心是持久化的假设树迭代优化。它不会把每次 AI 研究尝试都视为孤立事件,而是保存分叉假设,把实验结果作为证据回流,并且只有在留出集结果支持时才提升改进。
该项目面向长周期研究循环,其中智能体会生成想法、运行实验、总结证据,并更新累积的假设树。页面链接了论文、GitHub 仓库、文档和在线演示
WavFlow 是一种原始波形音频生成模型,专为高保真音频合成而设计,没有潜在压缩或 VAE 瓶颈。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 WavFlow 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的 AI 生成或 AI 分析的内容。
GenRecon 是一个多视图 3D 场景重建框架,旨在从休闲智能手机视频或多视图 RGB 图像生成完整的可编辑 PBR 就绪室内场景网格。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 GenRecon 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人
SEGA 是一种用于扩散变换器的分辨率外推方法,旨在无需重新训练即可生成稳定的超高分辨率图像。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 SEGA 没有提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
Flash-GRPO 是一种高效的视频扩散对齐方法,旨在在计算预算紧张的情况下改进视频扩散模型对齐。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Flash-GRPO 不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的 AI 生成或 AI 分析的内容。
PiD 是一种像素扩散解码器,专为潜在图像生成系统的快速高分辨率潜在解码和上采样而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 PiD 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
PiD
L2P 是一种潜在到像素的传输范式,旨在构建强大的像素空间扩散模型,而无需从头开始训练。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 L2P 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
L2P
TriSplat 是一种前馈 3D 场景重建方法,旨在从稀疏视图生成可用于仿真的网格状场景重建。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 TriSplat 不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
LiTo 是一种表面光场标记化方法,专为具有依赖于视图的外观的高质量图像到 3D 生成和重建而设计。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 LiTo 不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能生成或人工智能分析的内容。
RecGen 是一个生成 3D 重建框架,用于从稀疏 RGB-D 观测中恢复完整的多对象场景。即使场景的大部分被遮挡隐藏,RecGen 也不会将每个可见片段视为整个对象,而是估计完整的对象形状、纹理和 6-DoF 姿势。该系统专为机器人、嵌入式人工智能、模拟和场景理解工作流程而设计,其中相机可能只能观察部分视图,但下游系统仍然需要可以操纵、模拟或评估的
SwiftI2V 是一种高效的高分辨率图像到视频生成框架,可将静态图像转换为高达 2K 分辨率的时间连贯视频。它针对生成视频的主要瓶颈:端到端高分辨率生成可能非常昂贵,而低分辨率生成和视频超分辨率可能会失去原始图像的保真度。 SwiftI2V 旨在保持输入图像条件良好,同时减少高分辨率输出所需的计算量。
该框架使用条件分段生成,将
CDM(连续时间分布匹配)是一种用于生成高保真图像的扩散蒸馏方法。它旨在使扩散模型以很少的推理步骤生成强大的图像,减少延迟,同时保留纹理、细节和提示对齐。该项目专注于将大型图像生成器提炼为更快的采样器,而不依赖于额外的 GAN 损失或奖励模型目标。
该方法将分布匹配蒸馏从离散调度迁移到连续时间优化框架。这使得 CDM 可以更好地使
AsymFlow 是一种用于可扩展高维像素生成的非对称流建模方法。它旨在通过改变速度预测的参数化方式来使像素空间生成模型更具竞争力。 AsymFlow 没有强制模型直接预测高维噪声,而是将噪声预测限制在低秩子空间,同时保持数据预测全维。
该方法从不对称预测结构中分析恢复全维流速,而不需要不同的网络架构或新的采样程序。这使得 Asy
Warp-as-History 是一种相机控制的视频生成方法,可将相机引起的扭曲转变为预训练视频模型的控制接口。它可以在有限的监督下实现视点操纵和摄像机轨迹跟踪,使用视频历史记录不仅仅是简单的上下文。该方法旨在生成交互式视频,用户希望在不添加单独的相机控制模块的情况下引导相机运动。
该技术将所需的摄像机运动转换为摄像机扭曲的伪历史