IT之家 09-11
小米开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。

官方表示,Xiaomi-CocktailASR-1 旨在解决 " 鸡尾酒会 " 难题(IT 之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。

该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到 SOTA,大幅领先现有方案。

同时,其单人识别性能比肩标准 ASR 模型,可无缝兼顾单人说话场景;具备拒识非目标说话人干扰语音的能力,目标不在场时输出空文本,有效避免误触发;此外还支持思维链推理模式,为识别结果提供可解释推理过程。

IT 之家附相关链接:

GitHub:https://github.com/xiaomi-research/xiaomi-cocktailasr-1

HuggingFace:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

语音识别 小米 开源 it之家
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论