关键功能

AMD 推出的完全开放专家混合语言模型。
总参数量 16B,每个 token 激活约 2.8B 参数。
在 AMD Instinct MI300X 和 MI325X GPU 上从头训练。
发布了覆盖预训练、中期训练、SFT、DPO 和 RL 阶段的检查点。
为多个训练检查点提供 Hugging Face 模型链接。
包含公开 GitHub 仓库,用于代码和技术资源。
面向高效 MoE 推理和开放 LLM 实验设计。
记录了模型架构、训练流程和基准定位。

该发布覆盖完整训练流程,包括预训练、中期训练、长上下文扩展、监督微调、直接偏好优化和强化学习。AMD 提供了多个检查点,便于研究者查看和复用不同阶段,而不是只拿到最终指令模型。


Instella-MoE 适用于开放 LLM 研究、高效推理、训练流程研究和 AMD GPU 优化。其公开代码、公开检查点和完整训练阶段文档的组合,使其对需要可复现 MoE 模型开发的团队非常有价值。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!