该架构使用 512 个路由专家、8 个路由专家加上每个代币 1 个共享专家,以及将 KDA 与门控 MLA 相结合的原生混合线性注意力。其预热稳定和合并训练方法用加权检查点合并取代了传统的学习率衰减,支持持续预训练和动态数据扩展。
这个检查点有意成为一个基础模型,而不是一个现成的聊天助手。它对于研究人员和团队构建领域适应模型、测试长上下文 MoE 系统、探索持续预训练或从 Ling-3.0-tiny-base 到更大的 flash 模型的扩展策略非常有用。
该架构使用 512 个路由专家、8 个路由专家加上每个代币 1 个共享专家,以及将 KDA 与门控 MLA 相结合的原生混合线性注意力。其预热稳定和合并训练方法用加权检查点合并取代了传统的学习率衰减,支持持续预训练和动态数据扩展。
这个检查点有意成为一个基础模型,而不是一个现成的聊天助手。它对于研究人员和团队构建领域适应模型、测试长上下文 MoE 系统、探索持续预训练或从 Ling-3.0-tiny-base 到更大的 flash 模型的扩展策略非常有用。
在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!


Get top updates in AI to your inbox every weekend. It's free!