星途科讯 9小时前
Meta发布首款实时音频模型Muse Voice Transcribe
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

Meta Superintelligence Labs(超智能实验室)正式推出 Muse Voice Transcribe,这是该公司开发的首款实时音频感知模型。

Muse Voice Transcribe 标志着 Meta 在实时语音模型落地应用上的重要里程碑。该模型支持实时流式语音转文字(ASR)、超过 20 人的说话人分离(Diarization)以及端点检测(Endpointing)。其具备多语言能力,可无缝处理语言切换,并通过语言、关键词和上下文偏置技术进一步提升准确率。

数据显示,截至 2026 年 9 月 1 日,Muse Voice Transcribe 在流式语音转文字及公开说话人分离基准测试中均位列第一。

基于流式 ASR 的自回归架构

Muse Voice Transcribe 隶属于 Muse Spark 系列,是一款自回归多模态模型。音频以 80 毫秒(12.5 赫兹)为块进行处理,每个块被转换为一个软标记(soft token)。在处理每个音频块时,模型需决定是继续监听下一个音频块,还是输出文本标记。当模型选择继续监听时,会预测特殊标记 <|next_audio|>,并在下一次输入时将其替换为实际音频块。

当音频流停止时,系统插入特殊标记 <|empty_audio|> 告知模型音频结束。接收该标记后,模型将输出所有剩余文本标记,不再产生 <|next_audio|> 标记。

由于模型完全掌控监听时机,它可在转录前决定接收多少音频上下文(即 " 延迟 ")。准确率与延迟存在权衡:等待预测时间越长,转录越准确,但延迟越高。Muse Voice Transcribe 具备 " 自适应延迟 " 功能,可根据难度动态调整每个单词的延迟。该功能通过强化学习实现,将词错率(WER)奖励与延迟奖励相乘结合,从而在最终转录时间的速度与准确性权衡上达到帕累托前沿。

集成说话人分离与端点检测

基于流式 ASR 架构,通过引入额外特殊标记,该模型可轻松支持其他音频感知任务。

在说话人分离方面,模型引入 <|start_of_turn|> 标记潜在说话人切换,并使用 <|speaker_{A-Z}|> 标签区分不同说话人。一旦检测到切换,模型立即预测 <|start_of_turn|>,并将说话人标签预测推迟至块末尾。同一说话人的音频可能被 <|start_of_turn|> 分割,但片段间的说话人标签保持一致。

在端点检测方面,模型引入 <|speech_onset|> 标记语音开始,<|speech_endpoint|> 标记用户结束说话时刻。这两个任务与流式 ASR 联合训练,并在 ASR 奖励基础上增加了针对说话人分离和端点检测的额外奖励。

核心能力

语言覆盖

Muse Voice Transcribe 使用 70 多种语言训练,其中 25 种经过广泛验证。初始版本建议优先试用这 25 种已验证语言,同时也支持其他更多语言。

代码切换(Code-Switching)

针对双语使用者常见的语言混合场景,Muse Voice Transcribe 原生支持任意形式的代码切换,无论是句内还是句间。模型还利用上下文偏置进一步提高识别准确率。

长上下文处理

模型原生支持超过一小时、多达 20 多名说话人的长音频输入,无需进行后处理。

应用场景

目前,Meta AI 和 Muse Code 中的语音听写功能已由 Muse Voice Transcribe 驱动。用户只需按住 'Fn' 键,即可通过 Meta AI 处理屏幕上的任何窗口任务。该模型现已通过 Meta Model API、Mac 版 Meta AI 以及 Muse Code 开放获取。

【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

准确 spark
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论