寻找最新最佳的AI人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Wonder 是一个用于图像和视频条件世界生成的交互式视频世界模型。它能够构建持久环境,用户可通过相机移动进行导航,同时逐步显现未见区域,并以一致的视觉记忆返回先前视角。
该系统结合了稠密控制信号、全保真记忆机制、对历史的稀疏注意力以及校正蒸馏训练策略。其设计目标是在真实、卡通和类游戏世界中保持几何结构、外观、动态以及交互控制的一
ReDesign 是一个开源研究项目,通过智能体式分解从图像中恢复可编辑的设计结构。它可将平面截图或视觉设计图像转换为结构化元素,以更接近真实设计文件的方式进行检查、重建和编辑。
该系统将视觉布局分解为有意义的设计组件,利用智能体式推理识别文本、形状、层级和布局关系。其目标是在静态图像与可编辑设计表示之间架起桥梁,服务于 Figm
Laguna S 2.1 是 Poolside 发布的编码与推理模型,聚焦更长时程的软件工程工作。它被定位为能在复杂代码库上推理并执行延展型开发任务的显著改进版本。
该发布讨论了在软件工程基准上的评测,包括 Terminal-Bench、SWE-Bench 各变体、DeepSWE、代码库问答以及工具辅助编码工作流。Poolside
ShotPlan 是一个电影化视频生成框架,可让文生视频模型显式控制硬切、柔性转场和定时相机运动。它允许用户指定镜头结构和转场帧,而不是仅依赖模型从文本中推断电影节奏。
该方法向预训练视频扩散 Transformer 注入可学习的规划 token,并为其分配带小数时间位置的 RoPE 编码。这些 token 会在去噪过程中引导模型
Open-Dreamer 是 Next State 推出的一个开放项目,聚焦如何训练前沿级世界模型。它以实战视角介绍模型设计、训练经验、失败案例、修复方法,以及一个运行在 Reactor 上的可玩实时演示。
该系统覆盖因果视频 tokenizer、动作条件潜动态模型、数据集准备、训练工作流、token 化、rollout 和评测。
Instella-MoE 是 AMD 完全开放的专家混合语言模型,总参数量为 160 亿,每个 token 激活约 28 亿参数。它在 AMD Instinct MI300X 和 MI325X GPU 上从头训练,是一次透明开放的模型发布。
该发布覆盖完整训练流程,包括预训练、中期训练、长上下文扩展、监督微调、直接偏好优化和强化学
Mage-Flow 是微软的一个研究型模型家族,用于原生分辨率图像生成和基于指令的图像编辑。它是一个紧凑的 4B 模型家族,旨在在支持快速交互式推理的同时生成高质量图像。
该项目强调原生分辨率生成、精确编辑和四步交互式推理。其方法面向实际编辑和生成工作流,适合需要快速反馈、准确指令遵循以及在相对紧凑模型中获得强视觉质量的用户。</
Ideogram 4 是一款开放权重图像生成模型,面向设计工作、真实感 2K 输出、多语言文字渲染和精确布局控制。它为需要强提示遵循和可编辑设计元素的创作者、开发者和企业而设计。
该模型在重建图像前先学习理解结构,采用“描述到结构到重建”的流程来识别物体、背景、排版、构图和布局。因此,它适合海报、产品视觉、营销素材、UI 模型稿以
Nanbeige4.2-3B 是一个紧凑型智能体语言模型,拥有 3B 非嵌入参数。它旨在以小模型体量结合强智能体行为、广泛推理、代码能力和对齐能力,比更大的系统更易于实际运行。
该模型采用 Looped Transformer 架构,通过复用 Transformer 层在不增加参数的情况下提升有效容量。其训练强调智能体脚手架、可执
MiniMax H3 是一个通用型全模态生成模型,能够理解文本、图像、视频和音频之间的多模态上下文。它旨在超越单任务生成器,通过单一模型家族实现更丰富的跨模态推理与生成。
该模型可生成带原生立体声音频的视频,支持最高 2K 分辨率输出,并可生成最长 15 秒的片段。其设计将多模态上下文理解与生成结合起来,适用于声音、运动、视觉细节
ShadowDancer 是一个视频世界模型研究项目,通过从同步影子对中学习统一的动态表示,让单一模型掌握多种不同动作。它将动态与外观分离,因此可把动作迁移到新的视觉世界中。
该方法构建影子对,执行跨影子预测,并使用块因果世界模型支持动作可控的 rollout。示例涵盖人体动作、战斗风格运动、相机控制和机器人操作,展示了跨多类动态
PRISM 是一个机器人研究项目,用于学习面向交互结构化运动控制的多项式表示。它让机器人可观测信号之间与动作相关的交互关系变得显式、紧凑且可学习,从而在不增加新传感器的前提下提升控制效果。
该方法向策略学习中加入多项式交互特征,使控制器能够捕捉状态变量之间的乘积与关系。实验涵盖类人行走、低摩擦跟踪和富接触操作,显示其优于标准控制基
Seedance 2.5 是字节 Seed 推出的视频生成模型,用于创建更长的叙事片段,并具备更强的提示遵循、镜头连续性和面向制作的控制能力。它面向需要从文本和视觉参考中获得电影化运动、角色一致性以及灵活场景调度的创作者。
该模型聚焦参考感知生成与编辑,使用户能够比基础文生视频流程更精确地控制风格、主体身份、镜头行为和场景变化。其
SANA-Video 2.0 是 NVIDIA 的一项研究项目,采用混合线性注意力和注意力残差实现高效视频生成。它面向最高 720p 的高质量视频,同时降低全 Softmax 注意力带来的延迟和扩展成本。
该模型使用 Hybrid Linear-Softmax Attention,并通过周期性 softmax 锚点和 Block
Inkling-Small 是 Thinking Machines Lab 推出的开放权重多模态专家混合模型。它旨在以更小的资源占用匹配更大 Inkling 模型的大部分能力,并提供可控的推理强度。
该模型面向推理、智能体任务、多模态、认知校准和安全。Thinking Machines 将其定位为一个可通过 Tinker 微调的紧
HOMIE 是一个以人和物体为中心的视频个性化模型,用于生成包含人物和物体的个性化视频。它通过多模态认知增强,在处理复杂人机物组合与交互的同时保持主体一致性。
该项目面向参考到视频生成场景,即人物、物体或人物与物体组合需要在生成运动中保持可识别性。其演示展示了主体内部与主体之间的组合、物体交互,以及建立在开放视频生成基础之上的个性
ID-V2V 是 Eyeline Labs 推出的身份保持型视频重风格化框架,可在保持人物身份和表演稳定的同时,对源视频施加场景、光照和风格变化。它面向那些即使在大幅视觉编辑下也必须保留面部相似度、表情、视线和口型同步的制作场景。
该方法将编辑驱动的合成与源驱动的身份保持解耦。它利用重光照面部区域、面部法线图、编辑关键帧和深度序列
Masked Visual Actions 是一个统一的机器人世界建模项目,使用遮罩视觉动作表示进行机器人视频控制。它将动作表述为一种视觉信号,可在不同机器人形态和环境中同时支持前向建模与逆向建模。
该方法使用渲染控制视频、参考图像和提示,生成对应的真实世界机器人视频行为。项目示例包括 DROID 训练域案例、未见夹爪、未见机器人
PhiZero 是一个围绕物理语言构建的研究型世界模型。物理语言是一种从自然视频中学习到的、对世界状态转移进行紧凑离散表示的方法。它将物理推理与视频渲染分离,使系统能够先推理场景如何演化,再生成视觉输出。
该方法使用物理语言 tokenizer 和物理语言推理器,把视觉经验转换为可复用的转移 token。这使模型能够描述富含运动的
Qwen-Image 3.0 是 Qwen-Image 系列第三代基础图像生成模型。它专注于丰富内容、真实视觉细节、深层知识以及面向复杂 UI 的图像生成,适合实际创意与设计任务。
该模型面向的不只是单一简单主体提示,还能处理密集信息图、分镜、界面、多语言文本和知识密集型场景。Qwen 将其定位为通过结合细节渲染与更强的指令理解来