寻找最新最佳的开源人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Ornith-1.5 是一个开源模型系列,它将自我脚手架扩展到端到端的自我改进循环。它涵盖 397B 和 35B 专家混合模型以及 9B 密集模型,针对推理、编码和代理任务。
Ornith-1.5 不再仅仅依赖固定的人工管理任务和手工构建的工具,而是提出新任务、生成特定于任务的支架、推出解决方案,并使用强化学习来改进其策略。随着系
MiDashengLM-Gen是一个用于统一音频场景生成的端到端框架。给定结构化文本描述,它可以生成融合语音、音乐、音效和环境声学的连贯场景。
该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。
MiniMax Music 3.0 是一种音乐生成模型,可将创意概念和可选歌词转化为完整的歌曲。它在一代人的时间内创作、编曲、表演并产生结果。
该模型旨在保留长达五分钟的歌曲的表达意图,以物理真实感渲染乐器,并产生听起来像是表演的声音。其管道使用细粒度时间描述、全局局部混合LM、残差矢量量化、隐藏状态融合、流匹配和Flow-VAE
LTX-2.5 是 LTX 用于生成和编辑视频的开源基础模型。它将更强大的精炼模型与改进的即时理解、更清晰的运动、原生多镜头一致性、自动持续时间预测和专业媒体工作流程结合在一起。
该版本添加了更好的视频解码器、带有自定义提示增强器的 Gemma 4 12B 文本编码器、测试版精确视频编辑、原生 4K HDR 和 RAW 支持,以及
Qwen-Video-Edit 是一种基于指令的视频编辑方法,它重新利用图像编辑模型来直接编辑视频 VAE 潜伏。它可以对视频进行提示驱动的更改,而无需视频预训练的转换器。
系统通过 Wan 2.1 的 VAE 发送视频,通过两个小投影将其潜在空间桥接到 Qwen-Image-Edit DiT,并在潜在帧上应用网格旋转位置编码。
IndexTTS 2.5 是一种用于表达性多语言语音合成的零样本神经文本转语音基础模型。它建立在基于变压器的文本到语义模块和非自回归语义到梅尔模块的基础上,以重现语音特征和情感。
更新将语义编解码器从 50 Hz 压缩到 25 Hz,减少了序列长度和推理成本,并用更高效的 Zipformer 架构取代了早期的 S2M 主干。新的跨
MiniMax H3 是一个通用型全模态生成模型,能够理解文本、图像、视频和音频之间的多模态上下文。它旨在超越单任务生成器,通过单一模型家族实现更丰富的跨模态推理与生成。
该模型可生成带原生立体声音频的视频,支持最高 2K 分辨率输出,并可生成最长 15 秒的片段。其设计将多模态上下文理解与生成结合起来,适用于声音、运动、视觉细节
HOMIE 是一个以人和物体为中心的视频个性化模型,用于生成包含人物和物体的个性化视频。它通过多模态认知增强,在处理复杂人机物组合与交互的同时保持主体一致性。
该项目面向参考到视频生成场景,即人物、物体或人物与物体组合需要在生成运动中保持可识别性。其演示展示了主体内部与主体之间的组合、物体交互,以及建立在开放视频生成基础之上的个性
Open-Dreamer 是 Next State 推出的一个开放项目,聚焦如何训练前沿级世界模型。它以实战视角介绍模型设计、训练经验、失败案例、修复方法,以及一个运行在 Reactor 上的可玩实时演示。
该系统覆盖因果视频 tokenizer、动作条件潜动态模型、数据集准备、训练工作流、token 化、rollout 和评测。
ID-V2V 是 Eyeline Labs 推出的身份保持型视频重风格化框架,可在保持人物身份和表演稳定的同时,对源视频施加场景、光照和风格变化。它面向那些即使在大幅视觉编辑下也必须保留面部相似度、表情、视线和口型同步的制作场景。
该方法将编辑驱动的合成与源驱动的身份保持解耦。它利用重光照面部区域、面部法线图、编辑关键帧和深度序列
PRISM 是一个机器人研究项目,用于学习面向交互结构化运动控制的多项式表示。它让机器人可观测信号之间与动作相关的交互关系变得显式、紧凑且可学习,从而在不增加新传感器的前提下提升控制效果。
该方法向策略学习中加入多项式交互特征,使控制器能够捕捉状态变量之间的乘积与关系。实验涵盖类人行走、低摩擦跟踪和富接触操作,显示其优于标准控制基
Ideogram 4 是一款开放权重图像生成模型,面向设计工作、真实感 2K 输出、多语言文字渲染和精确布局控制。它为需要强提示遵循和可编辑设计元素的创作者、开发者和企业而设计。
该模型在重建图像前先学习理解结构,采用“描述到结构到重建”的流程来识别物体、背景、排版、构图和布局。因此,它适合海报、产品视觉、营销素材、UI 模型稿以
Masked Visual Actions 是一个统一的机器人世界建模项目,使用遮罩视觉动作表示进行机器人视频控制。它将动作表述为一种视觉信号,可在不同机器人形态和环境中同时支持前向建模与逆向建模。
该方法使用渲染控制视频、参考图像和提示,生成对应的真实世界机器人视频行为。项目示例包括 DROID 训练域案例、未见夹爪、未见机器人
CrisperWhisper 2.0 是 Nyra Labs 的逐字语音识别模型,用于转录人们实际说话的方式。它支持用于制作语音工作流程的可控输出样式、多语言转录、字级计时和长格式音频处理。
该系统区分保留填充、重复、截止和声音的逐字记录和生成更清晰可读文本的预期记录。它还通过监督 Whisper 式的交叉注意行为来提高对齐,以产
Nanbeige4.2-3B 是一个紧凑型智能体语言模型,拥有 3B 非嵌入参数。它旨在以小模型体量结合强智能体行为、广泛推理、代码能力和对齐能力,比更大的系统更易于实际运行。
该模型采用 Looped Transformer 架构,通过复用 Transformer 层在不增加参数的情况下提升有效容量。其训练强调智能体脚手架、可执
Inkling-Small 是 Thinking Machines Lab 推出的开放权重多模态专家混合模型。它旨在以更小的资源占用匹配更大 Inkling 模型的大部分能力,并提供可控的推理强度。
该模型面向推理、智能体任务、多模态、认知校准和安全。Thinking Machines 将其定位为一个可通过 Tinker 微调的紧
Instella-MoE 是 AMD 完全开放的专家混合语言模型,总参数量为 160 亿,每个 token 激活约 28 亿参数。它在 AMD Instinct MI300X 和 MI325X GPU 上从头训练,是一次透明开放的模型发布。
该发布覆盖完整训练流程,包括预训练、中期训练、长上下文扩展、监督微调、直接偏好优化和强化学
Laguna S 2.1 是 Poolside 发布的编码与推理模型,聚焦更长时程的软件工程工作。它被定位为能在复杂代码库上推理并执行延展型开发任务的显著改进版本。
该发布讨论了在软件工程基准上的评测,包括 Terminal-Bench、SWE-Bench 各变体、DeepSWE、代码库问答以及工具辅助编码工作流。Poolside
DeepSeek-V4-Flash-0731 是在 Hugging Face 上发布的开放权重语言模型,作为 DeepSeek V4 系列中更快、更小的激活参数变体。它针对需要强大能力和更高效推理的代理、编码和一般推理工作负载。
该模型包括一个推测性解码模块,并记录了用于 vLLM、SGLang 和本地推理流的服务。它的卡片强调
Mage-Flow 是微软的一个研究型模型家族,用于原生分辨率图像生成和基于指令的图像编辑。它是一个紧凑的 4B 模型家族,旨在在支持快速交互式推理的同时生成高质量图像。
该项目强调原生分辨率生成、精确编辑和四步交互式推理。其方法面向实际编辑和生成工作流,适合需要快速反馈、准确指令遵循以及在相对紧凑模型中获得强视觉质量的用户。</