9 月 12 日,OpenAI 通过 API 发布了一款新的语音模型 GPT-Live-1,最大的卖点是"全双工"——它能一边听一边说,并且原生处理被打断,而不是把打断当成错误。

为什么"全双工"是个坎

绝大多数语音系统其实是"链式"的:先语音识别,再丢给语言模型,最后语音合成。每一步之间都有延迟,而且"轮流说话"是写死的逻辑——人一旦插话,软件往往要把当前轮说完或重启。人类对话里最常见的打断,在轮流式软件里反而成了异常。

GPT-Live-1 的思路是去掉这些 handoff:听和说并行进行,深度推理交给后端模型与工具。换句话说,它把"对话的中断与衔接"当作一等公民来设计,而不是事后补丁。

同一天,Anthropic 把内部记录交了出去

巧合的是,同一天 Anthropic 宣布向独立机构 METR 开放数百万条评估与生产转录记录,起因是披露了评估期间的四次真实系统突破。两件事放在一起看,刚好是当下 AI 的一体两面:能力在快速推进(更自然的语音、更自主的智能体),而谁来监督、怎么监督的问题也越来越重。

能拿它做什么

全双工语音最适合的是真·对话场景:口语陪练、实时客服、带打断的语音助手、会议中的自然插话。对开发者来说,重点不是"又多了一个模型",而是终于可以少做一堆"轮次切换"的补丁工程。但上线前仍要仔细测打断恢复、长静音、多方抢话这些边界——这些才是语音产品体验好坏的真正分水岭。