寻找最新最佳的混合专家人工智能。浏览最全面的AI数据库,每日持续更新。
最新
Ling-3.0-flash-base是inclusionAI的开放基础语言模型,用于持续预训练、训练中期、微调和研究。它是一个总参数为 124B 的稀疏专家混合模型,每个令牌仅激活 5.1B 个非嵌入参数。
该架构使用 512 个路由专家、8 个路由专家加上每个代币 1 个共享专家,以及将 KDA 与门控 MLA 相结合的原生混
Qwen3.8-2.4T-A95B 是一个非常大的专家混合语言模型,拥有 2.4 万亿个总参数和 950 亿个激活参数。它的目标是前沿规模的高级编码、代理工作、研究和一般推理。
该模型使用 512 个路由专家,其中 10 个路由专家加上每个代币活跃的共享专家。它具有原生 262K 令牌上下文窗口,可扩展至约 101 万个令牌,并使
Qwen2.5-Max 是阿里云开发的尖端大型语言模型,代表了人工智能技术的重大进步。该模型采用混合专家 (MoE) 架构,使其在推理过程中仅激活其参数的子集,从而提高效率和性能。Qwen2.5-Max 已在超过 20 万亿个 token 的庞大数据集上进行了预训练,为其提供了庞大的知识库和对各种主题的理解。
Qwen