← Gimbo's Universe / Ideas / Voice · 全双工
视频导读 · AI 语音

你的语音助手
其实是一台对讲机.

2013 年的电影《Her》里,Theodore 爱上了他的 AI 助手 Samantha。十三年后的 2026 年 7 月,OpenAI 发布 GPT Live;再往前两个月,Thinking Machines 公布了他们的 interaction models。前沿实验室突然一起往这个方向冲,是因为语音这条线上刚刚发生了一次换挡——而它跟「模型更大了」几乎没关系。你手机里那个语音助手,架构上就是一台对讲机:单信道,一次只能一个方向,所以你说完它才能说。这篇导读把 Julia Turc 的这期视频拆成八段,包括她对 Kyutai 联合创始人、Gradium CEO Neil Zeghidour 的访谈——他的团队比 OpenAI 早两年做出了世界上第一个全双工模型,然后他转头去做了级联。

原片
How far are we from "Her"? · Julia Turc
嘉宾
Neil Zeghidour · Kyutai 联合创始人 / Gradium CEO
字幕
NotebookLM 全文转录 · 3,338 词
立场
导读忠实原片 · 人名与机构拼写另行核实

十三年后,
那个设定到期了

《Her》上映时,Samantha 是科幻设定。现在它变成了一份产品规格说明书——而且不止一家在照着抄。

视频用了一个很省事的开场:先放《Her》里那句「你这名字哪来的」「我自己给自己起的」,然后直接跳到 2026 年 7 月——OpenAI 发布 GPT Live,号称是 ChatGPT 语音助手的一次「有意义的升级」。而在那之前两个月,前 OpenAI CTO Mira Murati 创办的 Thinking Machines 公布了他们所谓的 interaction models:实时响应,而且会非常主动地插话。演示里那句「我坐姿驼背了你提醒我」——它真的在你还没说完的时候就打断你了。

作者的问题因此不是「哪家更强」,而是两个更根本的:为什么前沿实验室突然一起往这个方向冲?以及这批新的语音 agent 到底改了什么,才能流畅和灵敏成这样?

她找的答案人是 Neil Zeghidour——在大厂做了多年音频技术,Google Meet 和 NotebookLM 背后的音频能力有他的份;后来创办了巴黎的非营利实验室 Kyutai,做出了世界上第一个全双工助手。而「全双工」正是这一轮所有发布共用的那类新模型。

三个模式,
不是三档画质

打开 ChatGPT 的语音,里面有 standard、advanced、live 三个选项。作者说她读了十来篇论文才反应过来:这不是质量档位,是三种在概念上完全不同的「怎么给对话建模」。

Standard · 级联

把语音翻译成文字,
再翻回来

CASCADE · HALF DUPLEX

底座是纯文本模型,自己既听不见也发不出声。语音接口是外挂的一整条流水线:VAD 每 30 毫秒左右做一次二元判断(你在说话,还是安静),静音够久就判定你说完了;ASR 把这段语音转成文字;文本模型读文字、写文字;TTS 把回复念出来。

问题出在中间那一步:声学在转写里丢掉了。模型收到的只是字,语气、音量、节奏全没了。

声学信息转写时丢失
延迟逐级累加 · 前代数秒
能边说边听不能
Advanced · 端到端

没有文字瓶颈,
但一次只能一件事

END-TO-END · HALF DUPLEX

底座是 GPT-4o,o 代表 omnimodal——文本、音频、图像、视频都能直接处理,不必先挤过文字这道关口。端到端模型不一定是一整块,但它的各个部件是在语音数据上一起训练的,所以输入的声学从头到尾没丢,去掉文本瓶颈之后延迟降到接近人类。

但它离 Samantha 还远:它一次只能做一件事——要么说,要么听,绝不同时。普通对话也像在来回交接一根接力棒。

声学信息全程保留
延迟接近人类水平
能边说边听不能
Live · 全双工

把「轮次」这个
概念本身扔掉

FULL DUPLEX · TIME-BASED

GPT Live 不再把对话看成一串轮流发言。它是基于时间的:持续接收、持续输出,20 毫秒切一块。用户流和助手流两条并发,谁都不中断。

于是它能处理一件很小但很难的事:你在它说话时「嗯」了一声——那到底算不算打断?AI 能自然地和人重叠,才是 GPT Live 更靠近《Her》的地方。

声学信息全程保留
粒度20ms / 块
能边说边听能
麦克风→ VAD · 每 30ms 判一次→ ASR · 转写→ 纯文本 LLM · 声学已丢失→ TTS · 念出来→ 扬声器
现场试探 · Standard 模式
作者我现在在图书馆,你听得出来吗?我在压低声音。
助手听起来你确实说得比平常轻。不过我并不精确测量你的音量,只是你的声音听上去像耳语。
作者那你能给我 beatbox 一段吗?
助手boots and cats and boots and cats bsts cats cats bffs brumies cats

这就是级联的自白。「我不测量你的音量」——因为到它手上的时候,你的声音已经是一行字了。而 beatbox 崩成一串乱码,是因为负责发声的 TTS 只会「念文本」,它拿到的是一串拟声词,不是节奏。

现场试探 · Advanced 模式
作者你打个节拍,我来 rap。
助手行,来吧——(真的打出了一段节拍)

节拍谈不上准,但它开始像是音频原生的了。这是端到端和级联之间那道看得见的分界线:一个在念字,一个在发声。

现场试探 · Live 模式
作者你能 beatbox 吗?
助手抱歉,我不会 beatbox,不过我能帮你做很多别的。
作者那讲讲电影《Her》的剧情。
助手Theodore 是近未来洛杉矶的一个孤独的代写信件的人,他买了一个新的 AI——(作者在这里插了一声「wow」,它没有停)

注意这里的取舍:Live 反而不会 beatbox 了。它不是每个维度都更强——它强的是互动。作者插的那一声叫 back channeling(回应式插话),人类经常做,用来表示「我在听」。听起来平淡无奇,但对语音助手是个真难题:它必须判断你这次介入该不该中断对话。

一个必须标注的不确定视频里说 standard 模式的底座是 GPT-5.5——依据是「你去问助手,它会这么告诉你」。模型自述身份是出了名的不可靠,这一条我按原片记录,但不当硬事实用。真正重要的、也不依赖这个型号号的,是结构本身:标准模式的底座是一个纯文本模型,它自己既听不见也发不出声。

对讲机为什么
要说「over」

全双工 / 半双工不是 AI 圈的新词,它来自通信:信道能不能同时双向传输。

半双工的经典器物是对讲机——1940 年前后由 Donald Hings 发明,二战中大规模使用。它只有一根天线,既当发射器又当接收器,所以物理上不可能同时收发。这就是为什么士兵每说完一句要喊一声「over」:那不是军事礼节,那是在人工交接信道。

全双工则是信道同时双向。OpenAI 描述 GPT Live 用的正是这个词。而传统的轮次制系统——包括今天绝大多数你用过的语音 agent——全都是半双工:信道确实是双向的,但同一时刻它要么在听,要么在说。

半双工 · 你今天用的那个
单信道
用户说
over
助手说
over
用户说

一条信道轮流用。中间那两格就是交接成本——在对讲机上它是一声「over」,在语音助手上它是 VAD 等你安静够久。你以为的「反应慢」,一大半是它在等你确认说完了。

全双工 · 这一轮新东西
用户流
提问
静音
嗯嗯
静音
下一个问题
助手流
静音
开始回答
不让路
继续说
边说边收

两条并发的音频流,谁都不会被中断。用户不说话时,那条流承载的是静音——而静音被当成普通音频一样建模,不是「没有信号」,是一种信号。于是没有轮次可交接了。看最后一格:助手还在回答第二个问题,第三个问题已经进来了。换成轮次制系统,这里是一个不可能的选择——要么把自己的话砍断,要么漏掉这个新问题。

扔掉轮次,
只留时间

GPT-4o 和 GPT Live 只差两年——按 AI 的年份换算大概是 200 年。你会以为差距来自规模:更多参数、更多数据、更快的 GPU。作者说,不一定,而且那大概只占很小一部分。

真正的解锁在于 GPT Live 给对话建模的方式完全不同。传统模型把整场对话压进一条「你一句我一句」的交替序列——这些片段叫 speaker turns(说话人轮次)。但真实对话里,轮次是重叠的。《Her》那场戏里,Samantha 一次次在别人说话时插进来,这才是它像人的原因。

它们不是基于轮次的,
是基于时间的交互.

Mira Murati · 前 OpenAI CTO · Thinking Machines 创始人 · Bloomberg 访谈

她的完整表述是:持续接收音频、文本、视频,持续给出输出;把这些切成 20 毫秒的块,这样才能捕捉到打断和同时说话这类东西。作者对这句话的翻译很干脆:这类模型彻底扔掉了「说话人轮次」这个概念本身。

整件事最反直觉的一句静音也要建模。在全双工的设定里,用户那条流从不停止——他不说话的时候,那条流承载的是静音,而静音像任何一段普通音频一样被建模。这一句听着像技术细节,其实是整个范式的支点:一旦「没在说话」也是一种被持续读入的信号,就不再需要任何人去判断「他说完了吗」,VAD 那个每 30 毫秒一次的二元判断从根上被删掉了。

比它早两年的,
是十个人

GPT Live 上了头条,但它不是世界上第一个全双工——第一个来自巴黎一间非营利实验室,比它早整整两年,而且是开源的。

Moshi,出自 Neil Zeghidour 的非营利实验室 Kyutai。团队不到 10 个人,不到 6 个月,给整个语音助手行业定了一个新方向。直到 2026 年 7 月初,它是世界上唯一的全双工模型——独自领跑了将近两年。

< 10

Kyutai 做出 Moshi 的团队人数。不到 6 个月。

2 年

Moshi 领先 GPT Live 的时间。开源,且在这两年里是世界上唯一的全双工模型。

~100

训练用的 H100 数量,训了大约一个月。对前沿实验室来说这是个零头。

MacBook

量化之后能跑的地方。而且它的响应比人类平均还快。

他们为什么做这个 · 几乎是意识形态的Neil 的原话大意:当你用人的手强行摆出一个级联、而不是把它消化成单个神经网络,你就是在违背机器学习的哲学。所以总有一种冲动,想去试试。

还有一段很好笑的坦白:他说,当时我们连 full duplex 是什么意思都不知道。要发公告推文的时候,有人提醒我「哎你这东西叫全双工」,我一看——行,是全双工。然后我们就开始到处吹自己有一个全双工模型了。

一帧拆成八条,
外加一条内心独白

这一段是全片信息密度最高的地方——它解释了「音频 token」到底是什么,以及为什么把文字请回来不等于退回级联。

01

先把音频切成能一个个预测的小块

最天真的做法是直接预测原始振幅——但实时语音意味着每秒至少 24,000 次顺序预测,最新的 GPU 都吃不消。所以通用做法是切成固定长度的帧,大约 80 毫秒一帧。这就是音频版的 token。

02

但音频比文字「厚」:它同时装着两样东西

类比并不完美,因为音频是更丰富的信号——它同时携带语义(说了什么)和声学(怎么说的)。Neil 和团队早在 Google 做 AudioLM 时就提出了这个分解。

03

Moshi 把一帧拆成 1 + 7

1 个语义 token + 7 个声学 token。所以图上画的「助手那一条音频流」其实是八条,每个子 token 一条。这些子 token 的行为和文本 token 非常像:既能映射成整数 id,也能映射成实数嵌入。

04

八条流之间被人为地插了延迟

声学 token 在预训练时延后 2 帧,在微调和推理时延后 1 帧。为什么有用?因为这是在强加一个概念上的层级:先生成粗粒度的语义(相当于音素或词),再用细粒度的声学把它发出来。

关键区分 · 内心独白不是 chain-of-thought五千多年前人类发明了抽象金字塔的顶端——书写。作者说,文字可能正是我们这个物种能够繁荣的原因之一,因为它是一种极其高效的信号。

Moshi 在设计上删掉了级联里的文字瓶颈,但它反对的是把一切都强行挤过文字;只要音频信号本身也在走,那么额外走一条文字是纯赚。于是文字以「内心独白」的形式回来了:一条与音频流并行输出的文本流。

但它和 LLM 的 chain-of-thought 完全不是一回事。CoT 是给模型额外的推理空间,代价是延迟;内心独白完全不延迟回复,它和音频同速前进。它的职责只有一个:把语音拴在语言上。没有它,Moshi 可能听起来是对的,但说不出有实质的东西。

所以 Moshi 本质上是一个词表被扩成多模态的 LLM——里面既有文本 token 也有音频 token;事实上它很大一部分权重就是从一个 LLM 初始化过来的,再和其余权重一起在语音数据上微调。

而内心独白还带来一个意外的好处:同一套架构,三种行为。

默认

语音 → 语音

文本流与音频流同速。这是 Moshi 的核心形态,也是全双工对话本身。

把文本流延后几秒

语音 → 文本

模型学会转写刚刚听到的音频——它成了一个语音识别模型。

反过来,把音频流延后

文本 → 语音

它成了一个 TTS。推理时它念的是用户给的文本,而不是自己的内心独白。

造出全双工的人,
转头去做级联

如果全双工这么诱人,为什么它没有遍地都是?这一段是全片最值得实践者读的部分。

创办了非营利 Kyutai 的 Neil,最近分拆出了一家营利公司 Gradium——而它做的是……级联系统的积木。

作者直接问了:什么改变了你的想法,你为什么加入了另一个阵营?

他的回答很实在:我们去看了市场在哪。Moshi 之后他们又发了一个东西叫 Unmute——流式的语音转文本 + 流式的文本转语音,一个开源框架,作用是把任何一个 LLM 变成能说话的。结果 大公司对它的兴趣远远超过对 Moshi 的兴趣。他的解释是:文本模型的采用已经成熟得多,很多公司手里早就有一个文本模型了,他们只想把它变成一个实时对话系统——Unmute 让他们一眼看见自己该怎么用。

级联 · 今天务实的答案

零件可换,
但声学会丢

你可以随时把管线里那个 LLM 换成本周最新最强的那个,其余部分不动。

作者的判断:如果你是一家银行在做客服,级联可以说就是对的东西。但这是短期视角。

端到端 · 长期的答案

一体最优,
但换不动零件

端到端的重大劣势:你没法轻松插上最新最好的 LLM——要换就得把整条管线重新端到端训一遍,而且前提是你拿得到那个 LLM 的权重。

所以这是有预算和人才去想长期的人才玩得起的路:OpenAI、Thinking Machines。

这个反转真正说明的事造出世界第一个全双工模型的人,用商业行为投票给了级联——不是因为他不相信端到端,是因为这两条路的时间尺度不一样。他自己在片尾给端到端追上的时间表是「一到两年」,而级联是今天就能交付的东西。这两个立场在同一个人身上并不矛盾,但读的时候要同时看见:他现在有一家做级联积木的公司。

后台在跑,
嘴上不能停

《Her》里 Samantha 说:「你有好几千封关于 LA Weekly 的邮件,可你好像很多年前就不在那儿工作了。」——她刚刚做的事叫 tool calling,她得去调 Gmail 的 API。

OpenAI 和 Thinking Machines 都已确认能处理这件事,做法是:核心的语音到语音模型把活委派给一个异步的后台模型(大概率是个强力 LLM),同时把对话继续下去。

Neil 把这个必要性说得很直白:后台那个 agent 要做很多处理——工具调用、推理、网络搜索等等,这要花几秒到几十秒。而你不想在这段时间里干等着。你要的是让对话的自然流动,和后台的计算异步进行。

这套机制他们在 Moshi RAG 里就引入了,Thinking Machines 的 interaction model 也在用。

01

往内心独白里丢一个特殊 token

Moshi 意识到自己需要外部帮助的那一刻,就在内心独白里放进一个特殊 token。这个 token 触发一个发往后台检索系统的请求。那条文本流在这里同时是控制通道。

02

用闲聊把那段沉默填掉

检索要花时间,一秒甚至更久。Moshi RAG 被专门训练过去填这段沉默——要么先给一个粗略答案,要么说一句「我帮你查一下」。作者的注脚很到位:这正是人类客服在等自己那套慢吞吞的系统加载时做的事。

03

文档到了,作为第四条流灌进来

检索结果以一串嵌入 token 的形式直接流进模型——更准确地说,它是加在原有三条流之上的第四条流,于是输出被检索到的事实锚定住了。

04

这套策略可以推广到任何后台委派

不只是 RAG。任何需要交给后台模型去做的事情,都能套这个形状:丢 token → 填沉默 → 结果作为新流注入。

STREAM 1 · 用户音频
持续读入,静音也是信号,永不中断。
STREAM 2 · 助手音频
实际是 8 条(1 语义 + 7 声学),声学被人为延后 1–2 帧。
STREAM 3 · 内心独白
与音频同速的文本流,不增加延迟;也是丢特殊 token 的地方。
STREAM 4 · 检索结果
后台取回的文档,作为嵌入 token 流式注入,用来锚定事实。

怎么给
「自然」打分

作者最后问:端到端要怎样才能真正成为主流范式?Neil 的答案不是算力,也不是数据量。

他的直觉是:到这个阶段,主要是一个后训练问题——造出对的合成数据,以及找到对的奖励模型。

然后是全片我觉得最锋利的一段。他说,你看文本模型:一个可验证问题的奖励是可以被精确计算的,所以后训练能 scale 得非常好。可是换到语音这边,你要问的问题是——

这段对话,
自然吗.

Neil Zeghidour · 论端到端语音模型真正的瓶颈

「非常难」,他说,很难为它找到一个客观的、自动的度量。什么叫自然?是停顿落在了对的位置?是语气对?还是说的内容有意义?你要怎么从两段十分钟的对话里挑出更好的那一段?——这就是为什么算力和参数不是这条线的瓶颈:你没法给「自然」写一个可以自动打分的函数。

时间表 · 他自称「有点悲观」

一到两年

「在极限上,端到端系统会追上来。」他给的窗口是 1–2 年,并说接下来一年左右会看到非常惊人的东西。

然后是全新一波挑战

小型化,
以及机器人

第一是小型化——让这些东西跑在设备上。第二,而且他说可能是最重要的:集成进机器人,或者任何不是手机、也不是电脑的东西。

不是它变聪明了.
是它终于能一边说一边听.

回到片名那个问题:离《Her》还有多远?作者的答案是「有点近,又有点远」——和 AGI 是同一个故事,球门柱随着每次发布往后挪。AI 在某一个维度上变得超人,同时在另一个维度上蠢得离谱;它的智能分布和我们非常不一样。这一期给出的最有用的东西不是一个日期,而是一把尺子:下次再有人说他们的语音助手「更自然了」,可以直接问一句——它能一边说一边听吗?如果不能,那它还是一台对讲机,剩下的都是调音。

视频最后换了个问题,作者自己表了态:她说自己完全支持更好的客服,也可能能接受一个 AI 治疗师,但友谊和爱是她明确划线的地方——「AI 不爱你;就算你此刻极度孤独,我向你保证,在你的家人或朋友里,有一个有血有肉的人是真的爱你的。」这是她的立场,不是这期的技术结论,但她愿意把它放在片尾,我觉得值得原样转述。

附 · 一点 builder 批注

第一件让我坐直的事,是我一直在选清晰度,其实在选架构。我天天用语音跟 AI 说话,那三个选项在我眼里一直是「省流 / 高清 / 蓝光」。看完才知道那是三种世界观:一个把我的声音翻译成字再翻回来,一个能听见我怎么说,一个能在我说话的时候说话。同一个入口下面藏着三种完全不同的东西,而界面完全没打算告诉你——这大概是这两年 AI 产品最普遍的一种错觉。

第二件,是「对讲机」这个比喻远远不止用在语音上。我造的那些 agent,全都是半双工的:我说完 → 它做 → 它说完 → 我看。中间那一格 over 就是我的等待。全双工那个设计里真正让我停下来的,是「静音也要当成信号建模」这一句——它等于说,「什么都没发生」也是一条必须持续读入的信息流。我自己那套东西最大的毛病恰好在这里:一件事静悄悄没动静的时候,系统里没有任何一条流在读它,于是承诺就静默地死掉了。全双工给的不是一个语音技巧,是一个「别让沉默变成盲区」的架构原则。

第三件,Moshi RAG 填沉默那一段我可以直接抄。检索要一秒,那就先说一句「我帮你查一下」——这是被训练进去的行为,不是话术补丁。我做的东西里,凡是后台要跑一会儿的,默认都是憋着不出声,然后一次性吐结果。等待时不静默,是一条能落地到我每一个循环里的规矩。

第四件是最实用的:级联 vs 端到端那个取舍,正是我每天在做的取舍。我所有的东西都是拼装式的——因为我要能随时把里面那个模型换成本周最好的那个。Neil 那句「端到端你插不上最新最好的 LLM,除非你重训整条管线,而且你还得拿得到权重」,第一次给我这个选择配了一个正经的名字:我不是在偷懒,我是在买可换零件权。而这个取舍是有保质期的——今天级联是对的,一到两年后可能就不是了,只是那个「不是了」需要前沿实验室的预算才能兑现。

几条必须写下来的保留。① 时间表来自一个在这条线上有商业利益的人:他刚成立了一家做级联积木的公司,同时说端到端一到两年追上——两个立场都要看见,我按原片记录,不当预测用。② 「100 张 H100 训一个月」听着便宜,但那是研究规模,不是能扛住真实流量的产品规模,两者差着一整个工程层。③ 视频里 standard 模式的底座型号是助手自述的,我在正文里已经单独标注了——模型自报家门不可信,但那一段的结论不依赖型号。④ 字幕是 NotebookLM 自动转录的,专有名词错得挺厉害(Kyutai 被转成 QAI / Coutai,Neil Zeghidour 转成 Nell Zagora,Mira Murati 转成 Na Murati,Moshi 有几处成了 motion)——所有人名机构名我都另行核实过拼写,技术数字回原文对照过。

最后是她划的那条线。我造了一整支 AI 舰队来打理我的工作、投资、健康和写作,所以「AI 不爱你」这句话对我是有分量的,值得当面接住:我造它们是为了杠杆,不是为了陪伴。这两件事在体验上会越来越难分辨——一个能一边说一边听、会在你停顿时轻声「嗯」一下的东西,本来就是照着「陪伴」的样子造的。所以这条界线得我自己划,而且得写下来,不能等到分辨不出来的那天再划。

—— 站上大多数 AI 导读讲的是模型能想什么。这一篇讲的是它能不能在你说话的时候说话:一个听上去像交互细节、实际上把整条技术栈从头改了一遍的问题。