关键功能

统一的语音、音乐、效果和氛围生成。
LLM 驱动的自回归生成。
每个令牌条件流匹配。
具有学习停止头的可变长度输出。
768 维语义声学潜伏。
16 kHz 输出时产生 25 Hz 潜在电流。
音频文本对齐预训练。
九种语言支持和情绪控制。

该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。


音频文本对齐预训练在生成训练之前将音频潜在映射到语言模型标记空间。其成果是一个针对多模式声音设计、交互式环境、合成数据和多语言表达音频生成的研究系统。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!