智东西 昨天
Meta甩出语音转写“神器”:准确识别中英文夹杂,支持超20人长聊1小时
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

智东西

编译 | ZeR0

编辑 | 漠影

智东西 9 月 2 日报道,今日,Meta 推出由 Meta 超级智能实验室开发的首个实时音频感知模型Muse Voice Transcribe

该模型提供实时流式自动语音识别(ASR)、支持超过 20 位说话人的语音分割以及端点控制功能,支持多语言,能处理超过 1 小时的长音频,可实现无缝语码切换,并通过语言、关键词和上下文偏好来提高识别准确率。

从示例来看,无论是讲中文、中式英语口音,还是中英文混合表达,这款模型的转写速度和效果都相当不错。

6a97610b5073e_6a97610b506ff_5

Muse Voice Transcribe 在 Artificial Analysis 流式语音转文本和公开语音分割基准测试中排名第一。(模型收录和排名截至 2026 年 9 月 1 日。)

该模型可通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。

其 API 定价为每 1000 分钟 3 美元(约合人民币 20 元),每小时 0.18 美元(约合人民币 1.21 元)。

一、可识别超 1 小时长音频、中英文夹杂、20 多个人同时说

Muse Voice Transcribe 已使用 70 多种语言进行训练,其中 25 种语言经过全面验证。

在初始版本中,Meta 建议用户试用 25 种已验证的语言,同时也提供对更多语言的支持。

6a975f8759d05_6a975f8759cd5_1

语言切换方面,Muse Voice Transcribe 原生支持任意语码转换,无论是在句子内部还是句子之间,还利用上下文信息进一步提高了识别准确率。

在下面的示例中,说话者随意转换中英文,结果能被识别得既快又准。

6a975fecbf227_6a975fecbf1ec_2

其模型原生支持超过 1 小时的长音频输入和超过 20 位的说话者,无需后处理。

6a97606e37422_6a97606e373da_3

只需单击一下,Meta AI 和 Muse Code 的语音听写功能即可由 Muse Voice Transcribe 提供支持。

它可以与任何应用程序配合使用,并可与 Meta AI 以及屏幕上的任何窗口配合使用,完成各种任务——只需按住 "Fn" 键即可尝试。

二、以流式自动语音识别为基础,动态调整延迟兼顾速度和准确率

Muse Voice Transcribe 是 Muse Spark 系列中的一个自回归多模态模型。

音频以 80ms(12.5Hz)为单位进行处理,每个音频片段都被转换为一个软 token。对于每个音频片段,模型会决定是继续监听下一个音频片段,还是输出一个文本 token。

当模型决定继续监听时,它会预测一个特殊 token,并将其替换为下一个输入的实际音频片段。

当音频流停止时,Meta 会插入一个特殊 token 来告知模型没有更多音频片段。模型收到,也就是 " 后续已没有音频输入 " 的信号后,就会直接输出所有剩余的文本 token,不再生成任何 token。

由于模型可以完全控制何时监听,因此它会在转写单词之前决定需要多少音频上下文信息(被称为 " 延迟 ")。准确率和延迟之间存在权衡。

模型等待预测的时间越长,转写结果就越准确,但延迟也越高。

Muse Voice Transcribe 具有 "自适应延迟" 功能,可根据每个单词的难度动态调整延迟。这是通过强化学习(RL)实现的,其中词错误率(WER)奖励和延迟奖励以乘法方式组合。

通过自适应延迟,该模型在速度和准确性权衡方面实现了帕累托前沿,以最终转写时间衡量。

三、基于 ASR 构建分区和端点功能

以流式 ASR 为基础,可通过引入额外的特殊 token 轻松支持其他音频感知任务。

为了实现说话人分割,Meta 引入一个 token 来指示潜在的说话人切换,并引入一个 tag 来区分不同的说话人。

说话人切换时,会立即被预测,而说话人 tag 的预测则会延迟到音频块的末尾。

来自同一说话人的音频也可以通过这种方式被切分成多个片段,这些切分片段的说话人 tag 都将相同。

以下是一个说话人分离的 token 序列示例(为简化演示省略了):

Hello, how are you doing? Did anything fun over the weekend? Hey I ’ m good!

对于语音端点检测,Meta 引入一个 token 来标记语音的开始,并引入一个 token 来标记用户说话结束。

以下是一个语音端点检测的 token 序列示例(为简化演示省略了):

Hey Meta, what ’ s the weather in Menlo Park? [ silence ] What should I wear today?

Meta 使用流式 ASR 同时训练这两个任务,并在 ASR 奖励信号基础上,分别针对说话人分离和语音端点检测任务增加额外奖励。

结语:语音识别向持续在线的 " 耳朵 " 演进

在现实场景中,人们交流的情景非常复杂,比如多语言交杂、有人时不时插话、多人说话声音重叠等等,以及可能连续聊上几十分钟甚至几个小时。Muse Voice Transcribe 此次重点展示的能力,便对这些真实场景的转写质量优化非常有帮助。

语音转写正在从一个独立的 " 语音转文字 " 工具,变成 AI 系统的实时感知层。下一阶段竞争的核心会同时落在低延迟、长上下文、多说话人、多语言与语境理解上,并最终与大模型的推理、记忆和工具调用融合。届时," 听见 " 只是入口,系统还要知道谁在说、什么时候说完、这句话和前面有什么关系,以及接下来该做什么。

来源:Meta

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 准确 智东西 语音识别 效果
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论