寻找最新最佳的AI人工智能。浏览最全面的AI数据库,每日持续更新。
最新
SenseNova-U1.5-8B-MoT 是用于图像理解、文本到图像生成和图像编辑的原生统一多模态模型。它旨在提高视觉质量、文本渲染、布局控制以及主题和未编辑区域的保留。
该模型建立在 NEO-unify 架构之上,改进了 patchify 层、数据质量、提示增强、任务制定和后期训练。它支持原生 4K 生成、本地和多参考编辑、对
Grok 4.6 是 xAI 的模型,适用于长期运行的代理、雄心勃勃的交互式工作、编码、研究和知识任务。它旨在跨多个步骤继续工作,从调查不熟悉的领域到生成精美的应用程序或工作工件。
该版本强调视觉和交互式项目的更强有力的首次通过、跨代码库的持续工作以及通过反馈持续改进。 xAI 报告使用精心策划的推理和技术数据、改进的优化器、监督
WorldClaw是腾讯混元推出的一款代理3D开放世界生成项目。它探讨了 AI 代理如何在大型交互式 3D 环境中创建、编辑和操作,而不是仅生成孤立的资产。
该系统将语言驱动的规划与 3D 世界构建和交互联系起来。其研究方向结合了场景生成、资产创建、空间推理和代理控制,以便可以大规模构建世界,然后将其用作可执行环境。
Ling-3.0-flash-base是inclusionAI的开放基础语言模型,用于持续预训练、训练中期、微调和研究。它是一个总参数为 124B 的稀疏专家混合模型,每个令牌仅激活 5.1B 个非嵌入参数。
该架构使用 512 个路由专家、8 个路由专家加上每个代币 1 个共享专家,以及将 KDA 与门控 MLA 相结合的原生混
MiDashengLM-Gen是一个用于统一音频场景生成的端到端框架。给定结构化文本描述,它可以生成融合语音、音乐、音效和环境声学的连贯场景。
该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。
MAGI-2 Preview 是 Sand.ai 的中间研究版本,探索可扩展的统一音频视频生成。它研究架构、训练系统和多模态数据如何在 100B 参数规模下协同工作。
该模型采用单流设计,具有 40 层主干、由多头混合专家层组成的稀疏中间层以及较小的激活专家集。训练系统重点关注通信、内核、路由稳定性、优化和内存效率。
GEN-1.5 是一个机器人基础模型,可以通过单个简短的演示来学习新的物理任务。它通过将感觉运动观察和动作轨迹映射到即时机器人行为来实现体现智能。
该模型可以在 30 秒的上下文窗口内放置一个演示,并在无需梯度更新或微调的情况下执行任务。它还可以在五分钟的任务数据上仅使用 1 到 10 个梯度步骤进行适应,而大规模物理交互体验的预
LTX-2.5 是 LTX 用于生成和编辑视频的开源基础模型。它将更强大的精炼模型与改进的即时理解、更清晰的运动、原生多镜头一致性、自动持续时间预测和专业媒体工作流程结合在一起。
该版本添加了更好的视频解码器、带有自定义提示增强器的 Gemma 4 12B 文本编码器、测试版精确视频编辑、原生 4K HDR 和 RAW 支持,以及
GLM-5.3是Z.ai的前沿编码和长视野智能体模型。它针对的是复杂的软件工程、研究工作流程以及需要代理跨多个相关步骤进行操作的任务。
该版本保留了 GLM-5.2 基本模型,并将其收益归因于扩展后训练。 Z.ai 扩展了可执行环境,合成了验证器,使用了异步强化学习,并为长任务保留了 SAO 压缩。
GLM-
MiniMax Music 3.0 是一种音乐生成模型,可将创意概念和可选歌词转化为完整的歌曲。它在一代人的时间内创作、编曲、表演并产生结果。
该模型旨在保留长达五分钟的歌曲的表达意图,以物理真实感渲染乐器,并产生听起来像是表演的声音。其管道使用细粒度时间描述、全局局部混合LM、残差矢量量化、隐藏状态融合、流匹配和Flow-VAE
Qwen3.8-27B 是一个密集的 270 亿参数视觉语言模型,适用于编码、专业工作、研究和长期代理任务。它可以理解文本和视觉输入,包括图像、文档、图表和视频。
该模型采用灵活的思维控制、原生多模态理解以及可扩展到 100 万个令牌的 262K 令牌上下文窗口。思维可以通过reasoning_effort进行调整,而preser
Qwen-Video-Edit 是一种基于指令的视频编辑方法,它重新利用图像编辑模型来直接编辑视频 VAE 潜伏。它可以对视频进行提示驱动的更改,而无需视频预训练的转换器。
系统通过 Wan 2.1 的 VAE 发送视频,通过两个小投影将其潜在空间桥接到 Qwen-Image-Edit DiT,并在潜在帧上应用网格旋转位置编码。
Ornith-1.5 是一个开源模型系列,它将自我脚手架扩展到端到端的自我改进循环。它涵盖 397B 和 35B 专家混合模型以及 9B 密集模型,针对推理、编码和代理任务。
Ornith-1.5 不再仅仅依赖固定的人工管理任务和手工构建的工具,而是提出新任务、生成特定于任务的支架、推出解决方案,并使用强化学习来改进其策略。随着系
MatrAIx 是数字产品和人工智能系统的模拟用户评估基础设施。它对 83 亿角色代理群体进行建模,以便团队可以测试不同用户对产品、对话、界面和工作流程的响应。
该平台围绕用户是谁、交互发生的地点和方式以及正在测试的应用程序或任务来组织评估。它支持调查、聊天机器人、网络和应用程序模拟,输出涵盖偏好、任务完成、帮助性、安全性、可用性
Muse Glimmer 是 Meta 的开放式 300 亿参数模型,适用于始终在线的本地代理。它针对工具使用、本地编码、多模式理解、长上下文记忆以及可在消费者 Mac 或 PC 上运行的代理工作流程进行了优化。
Meta 通过来自更大教师的蒸馏、更长的代理重数据、监督微调、策略蒸馏和强化学习来训练模型。量化可将模型压缩至 20
GeoWeaver 是一个长序列 3D 重建框架,用于将 RGB 视频转换为全局一致的摄像机和点云。它解决了无法联合处理长序列时出现的尺度漂移、姿态错误和块未对齐问题。
几何先验模型预测块深度、置信度和相机参数,然后分层测试时间适应执行顺序初始化、全局 Sim(3) 对齐和从粗到细的细化。密集对应和强大的 CDF 式目标共同优化加
LLM-as-a-Verifier 是一个通用验证框架,可为跨模式的代理输出提供细粒度的反馈。它将验证视为编码、机器人、医疗任务和其他二进制判断过于粗糙的领域的缩放轴。
该方法使用评分令牌逻辑的完整分布来估计连续奖励和评估不确定性,无需额外训练。它通过更精细的分数粒度、重复评估和评估标准分解来扩展验证,然后使用概率枢轴锦标赛在有限
IndexTTS 2.5 是一种用于表达性多语言语音合成的零样本神经文本转语音基础模型。它建立在基于变压器的文本到语义模块和非自回归语义到梅尔模块的基础上,以重现语音特征和情感。
更新将语义编解码器从 50 Hz 压缩到 25 Hz,减少了序列长度和推理成本,并用更高效的 Zipformer 架构取代了早期的 S2M 主干。新的跨
Needle 2 是一种紧凑的代理语言模型,用于微型设备上的工具调用、设备使用和结构化提取。完整的模型是一个 14 MB 的二进制文件,在大约 28 MB 的 RAM 中运行。
它建立在简单注意力网络的基础上,使用 Cactus Quants 压缩为 CQ2 位,并打包在 Cactus 自己的引擎中。浏览器演示在 WebAssem
Qwen3.8-2.4T-A95B 是一个非常大的专家混合语言模型,拥有 2.4 万亿个总参数和 950 亿个激活参数。它的目标是前沿规模的高级编码、代理工作、研究和一般推理。
该模型使用 512 个路由专家,其中 10 个路由专家加上每个代币活跃的共享专家。它具有原生 262K 令牌上下文窗口,可扩展至约 101 万个令牌,并使