关键功能

提供可控逐字和预期转录模式。
支持多种 Whisper 支持的语言的多语言语音识别。
捕捉填充词、重复词、口吃、错误的开头和声音。
为对齐敏感的工作流程生成精确的字级计时。
处理无缝长格式转录。
包括用于改进遗留语音数据集的 Verbatimize 工作流程。
Nyra Labs 公共 CrisperWhisper 存储库和模型资源的链接。
针对真实语音数据的生产就绪推理。

该系统区分保留填充、重复、截止和声音的逐字记录和生成更清晰可读文本的预期记录。它还通过监督 Whisper 式的交叉注意行为来提高对齐,以产生更精确的单词计时。


CrisperWhisper 2.0 对于临床文档、对话分析、语音数据集、字幕、播客工作流程和富有表现力的语音合成管道非常有用。其可控的风格切换可帮助团队选择对于任务而言,是对口语不流利的保真度更重要,还是可读性更重要。

在您的网站添加此徽章,以获得更多点赞并登上搜索结果顶部!

嵌入按钮预览 - 浅色主题
嵌入按钮预览 - 深色主题

Subscribe to the AI Search Newsletter

Get top updates in AI to your inbox every weekend. It's free!