寻找最新最佳的Free人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Ling-3.0-flash-base是inclusionAI的开放基础语言模型,用于持续预训练、训练中期、微调和研究。它是一个总参数为 124B 的稀疏专家混合模型,每个令牌仅激活 5.1B 个非嵌入参数。
该架构使用 512 个路由专家、8 个路由专家加上每个代币 1 个共享专家,以及将 KDA 与门控 MLA 相结合的原生混
Qwen3.8-2.4T-A95B 是一个非常大的专家混合语言模型,拥有 2.4 万亿个总参数和 950 亿个激活参数。它的目标是前沿规模的高级编码、代理工作、研究和一般推理。
该模型使用 512 个路由专家,其中 10 个路由专家加上每个代币活跃的共享专家。它具有原生 262K 令牌上下文窗口,可扩展至约 101 万个令牌,并使
Qwen-Video-Edit 是一种基于指令的视频编辑方法,它重新利用图像编辑模型来直接编辑视频 VAE 潜伏。它可以对视频进行提示驱动的更改,而无需视频预训练的转换器。
系统通过 Wan 2.1 的 VAE 发送视频,通过两个小投影将其潜在空间桥接到 Qwen-Image-Edit DiT,并在潜在帧上应用网格旋转位置编码。
Ornith-1.5 是一个开源模型系列,它将自我脚手架扩展到端到端的自我改进循环。它涵盖 397B 和 35B 专家混合模型以及 9B 密集模型,针对推理、编码和代理任务。
Ornith-1.5 不再仅仅依赖固定的人工管理任务和手工构建的工具,而是提出新任务、生成特定于任务的支架、推出解决方案,并使用强化学习来改进其策略。随着系
MatrAIx 是数字产品和人工智能系统的模拟用户评估基础设施。它对 83 亿角色代理群体进行建模,以便团队可以测试不同用户对产品、对话、界面和工作流程的响应。
该平台围绕用户是谁、交互发生的地点和方式以及正在测试的应用程序或任务来组织评估。它支持调查、聊天机器人、网络和应用程序模拟,输出涵盖偏好、任务完成、帮助性、安全性、可用性
IndexTTS 2.5 是一种用于表达性多语言语音合成的零样本神经文本转语音基础模型。它建立在基于变压器的文本到语义模块和非自回归语义到梅尔模块的基础上,以重现语音特征和情感。
更新将语义编解码器从 50 Hz 压缩到 25 Hz,减少了序列长度和推理成本,并用更高效的 Zipformer 架构取代了早期的 S2M 主干。新的跨
MiDashengLM-Gen是一个用于统一音频场景生成的端到端框架。给定结构化文本描述,它可以生成融合语音、音乐、音效和环境声学的连贯场景。
该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。
Qwen3.8-27B 是一个密集的 270 亿参数视觉语言模型,适用于编码、专业工作、研究和长期代理任务。它可以理解文本和视觉输入,包括图像、文档、图表和视频。
该模型采用灵活的思维控制、原生多模态理解以及可扩展到 100 万个令牌的 262K 令牌上下文窗口。思维可以通过reasoning_effort进行调整,而preser
WorldClaw是腾讯混元推出的一款代理3D开放世界生成项目。它探讨了 AI 代理如何在大型交互式 3D 环境中创建、编辑和操作,而不是仅生成孤立的资产。
该系统将语言驱动的规划与 3D 世界构建和交互联系起来。其研究方向结合了场景生成、资产创建、空间推理和代理控制,以便可以大规模构建世界,然后将其用作可执行环境。
Needle 2 是一种紧凑的代理语言模型,用于微型设备上的工具调用、设备使用和结构化提取。完整的模型是一个 14 MB 的二进制文件,在大约 28 MB 的 RAM 中运行。
它建立在简单注意力网络的基础上,使用 Cactus Quants 压缩为 CQ2 位,并打包在 Cactus 自己的引擎中。浏览器演示在 WebAssem
Muse Glimmer 是 Meta 的开放式 300 亿参数模型,适用于始终在线的本地代理。它针对工具使用、本地编码、多模式理解、长上下文记忆以及可在消费者 Mac 或 PC 上运行的代理工作流程进行了优化。
Meta 通过来自更大教师的蒸馏、更长的代理重数据、监督微调、策略蒸馏和强化学习来训练模型。量化可将模型压缩至 20
GeoWeaver 是一个长序列 3D 重建框架,用于将 RGB 视频转换为全局一致的摄像机和点云。它解决了无法联合处理长序列时出现的尺度漂移、姿态错误和块未对齐问题。
几何先验模型预测块深度、置信度和相机参数,然后分层测试时间适应执行顺序初始化、全局 Sim(3) 对齐和从粗到细的细化。密集对应和强大的 CDF 式目标共同优化加
MAGI-2 Preview 是 Sand.ai 的中间研究版本,探索可扩展的统一音频视频生成。它研究架构、训练系统和多模态数据如何在 100B 参数规模下协同工作。
该模型采用单流设计,具有 40 层主干、由多头混合专家层组成的稀疏中间层以及较小的激活专家集。训练系统重点关注通信、内核、路由稳定性、优化和内存效率。
SenseNova-U1.5-8B-MoT 是用于图像理解、文本到图像生成和图像编辑的原生统一多模态模型。它旨在提高视觉质量、文本渲染、布局控制以及主题和未编辑区域的保留。
该模型建立在 NEO-unify 架构之上,改进了 patchify 层、数据质量、提示增强、任务制定和后期训练。它支持原生 4K 生成、本地和多参考编辑、对
GEN-1.5 是一个机器人基础模型,可以通过单个简短的演示来学习新的物理任务。它通过将感觉运动观察和动作轨迹映射到即时机器人行为来实现体现智能。
该模型可以在 30 秒的上下文窗口内放置一个演示,并在无需梯度更新或微调的情况下执行任务。它还可以在五分钟的任务数据上仅使用 1 到 10 个梯度步骤进行适应,而大规模物理交互体验的预
LLM-as-a-Verifier 是一个通用验证框架,可为跨模式的代理输出提供细粒度的反馈。它将验证视为编码、机器人、医疗任务和其他二进制判断过于粗糙的领域的缩放轴。
该方法使用评分令牌逻辑的完整分布来估计连续奖励和评估不确定性,无需额外训练。它通过更精细的分数粒度、重复评估和评估标准分解来扩展验证,然后使用概率枢轴锦标赛在有限
Inkling-Small 是 Thinking Machines Lab 推出的开放权重多模态专家混合模型。它旨在以更小的资源占用匹配更大 Inkling 模型的大部分能力,并提供可控的推理强度。
该模型面向推理、智能体任务、多模态、认知校准和安全。Thinking Machines 将其定位为一个可通过 Tinker 微调的紧
ID-V2V 是 Eyeline Labs 推出的身份保持型视频重风格化框架,可在保持人物身份和表演稳定的同时,对源视频施加场景、光照和风格变化。它面向那些即使在大幅视觉编辑下也必须保留面部相似度、表情、视线和口型同步的制作场景。
该方法将编辑驱动的合成与源驱动的身份保持解耦。它利用重光照面部区域、面部法线图、编辑关键帧和深度序列
HOMIE 是一个以人和物体为中心的视频个性化模型,用于生成包含人物和物体的个性化视频。它通过多模态认知增强,在处理复杂人机物组合与交互的同时保持主体一致性。
该项目面向参考到视频生成场景,即人物、物体或人物与物体组合需要在生成运动中保持可识别性。其演示展示了主体内部与主体之间的组合、物体交互,以及建立在开放视频生成基础之上的个性
DeepSeek-V4-Flash-0731 是在 Hugging Face 上发布的开放权重语言模型,作为 DeepSeek V4 系列中更快、更小的激活参数变体。它针对需要强大能力和更高效推理的代理、编码和一般推理工作负载。
该模型包括一个推测性解码模块,并记录了用于 vLLM、SGLang 和本地推理流的服务。它的卡片强调