该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。
音频文本对齐预训练在生成训练之前将音频潜在映射到语言模型标记空间。其成果是一个针对多模式声音设计、交互式环境、合成数据和多语言表达音频生成的研究系统。
该系统将预训练的大型语言模型和音频标记器与每个标记条件流匹配相结合。它使用 25 Hz 的 768 维语义声学潜伏和学习的停止头以自回归方式生成可变长度 16 kHz 音频。
音频文本对齐预训练在生成训练之前将音频潜在映射到语言模型标记空间。其成果是一个针对多模式声音设计、交互式环境、合成数据和多语言表达音频生成的研究系统。
在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!


Get top updates in AI to your inbox every weekend. It's free!