17173 > 游戏资讯 > 科技新闻 > 正文

小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

2026-09-11 16:04:44 神评论
17173 新闻导语

小米开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1,破解“鸡尾酒会”难题,多人场景精准提取目标语音,性能达SOTA,支持思维链推理。点击了解详情!

感谢网友 顺势而为、Autumn_Dream 的线索投递!

9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。

官方表示,Xiaomi-CocktailASR-1 旨在解决“鸡尾酒会”难题(注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。

该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到 SOTA,大幅领先现有方案。

同时,其单人识别性能比肩标准 ASR 模型,可无缝兼顾单人说话场景;具备拒识非目标说话人干扰语音的能力,目标不在场时输出空文本,有效避免误触发;此外还支持思维链推理模式,为识别结果提供可解释推理过程。

附相关链接:

GitHub:https://github.com/xiaomi-research/xiaomi-cocktailasr-1

HuggingFace:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1

【来源:IT之家】
关于Xiaomi-CocktailASR,目标说话人语音识别,开源,大模型,鸡尾酒会问题,端到端LLM,声纹提示,SOTA,思维链推理的新闻
17173想了解一下大家怎么看17173的,以便提供更好的阅读体验,所以请各位路过的大佬们花一分钟时间看看这个问卷吧 一键参与