小米开源了工业级目标说话人语音识别模型 CocktailASR-1,专门解决多人同时发言时"听不清特定人"的鸡尾酒会难题。权重已免费开放,开发者可低成本接入。
传统方案先分离,它直接指定"听谁"
"鸡尾酒会问题"是语音领域的经典难题:一堆人同时说话,怎么只听清其中一个?传统做法先做盲源分离和降噪,再转录,链路长、容易互相拖累。CocktailASR-1 换了个思路——预先指定目标说话人的声学特征,模型就只输出对应那一个人的语音转录,不去管背景里其他人在说什么。
哪些场景立刻用得上
车载智能座舱里主驾下指令、会议转录里只抓某位发言者、嘈杂马路边用语音助手——这些真实环境的共同点是"有人想说、但周围很吵、还不止一个人"。目标说话人识别把这些场景里的拾音准确率直接拉高,而不用先做一整套分离降噪。
开源把门槛砸了下来
这类能力过去多在实验室或闭源商业方案里。小米的做法是把权重直接开放,意味着中小团队、独立开发者也能在自己的产品里接上"指定谁、就听懂谁"的能力。对语音交互产品来说,这算是把"最后一公里"又往前推了一步——不是让模型更会聊天,而是让它在真实噪音里更懂你到底在对谁说话。