收市随笔 恒指 24,030 -0.70%

GPT-Live 和《她》的时刻

OpenAI 发布第三代语音模式,采用全双工架构(full-duplex),取代一问一答。她会打断你、会笑、会焦躁、会犹豫——你已难以分辨对面是人还是机器。这对 AI 产业链意味着什么?

◆ 核心观点

全双工语音让"机器感"消失,语音(及未来视频)渗透率将突破式提升。三层影响层层递进:①渗透率↑→算力需求↑(语音≈文字 5×,视频≈语音 10×)、②延迟持续逼近人类极限(与 HBM、光互连最相关)、③实时会话不能排队→冗余算力非线性上升。板块上,云厂商、HBM、3.2T 光互连最受益。

是什么

全双工:从"一问一答"到"煲电话粥"Full-duplex voice

恕难用文字描述那种神奇——如果只用一句话:我已无法区分对面是一位跟我煲电话粥的人类,还是一个冰冷的机器人。

她会打断我、会笑、会焦躁、会犹豫;遇到难题,还会把问题转接给 GPT-5.5 后台思考查询,而这中间会继续对话,让用户感觉不到机器感。全双工架构取代了之前的一问一答模式——这是体验上的质变。

1 第一层

渗透率突破 → 算力需求抬升Penetration up, compute up

目前每周超过 1.5 亿人使用 ChatGPT 的语音和听写功能,渗透率约 15%;Claude、Gemini 等更低。渗透率提升的空间很大——而不同模态的算力需求差异悬殊。

各模态相对算力需求
以文字为 1×:语音≈5× · 视频≈语音的 10×(≈50×)
注:相对倍数为方向性示意,来自公开表述,非精确测算。
2 第二层

延迟:机器感消失的关键Latency toward the human limit

你问 AI 后它回你的时间,是"机器感"的核心。延迟一路下降,直到逼近人类大脑约 150ms 的反应极限,让人完全感受不到延迟。

语音应答延迟的下降
越短越"像人" · 越接近 150ms 人类极限,机器感越弱
注:延迟为代表性数值示意,非精确指标。
◆ 与硬件的关系

与降低延迟最相关的硬件是 HBM光互连。延迟还会继续下降,直到人类感受不出——这条路上,存储带宽与互连速率是硬约束。

3 第三层

实时并发:冗余算力非线性上升Real-time concurrency & redundancy

传统文字推理

可以排队

把一堆请求攒起来一起算(batching),提高 GPU 利用率。

实时语音会话

不能排队

低延迟 + 实时在线两个要求下,云厂商必须预留"够用又随时可调"的算力与网络,保证话音一落 AI 就接上。

▲ 关键结论

这会增加冗余算力的需求,而且这种需求随语音延迟的降低是非线性往上走的——越想"像人",越要预留冗余。

尾声

《她》的时刻Her, 2013 → now

◆ 随笔

2013 年的科幻片《她》(Her)里,男主角西奥多爱上了语音机器人萨曼莎。我们可以肯定:未来会有很多人也爱上机器人——饮爱情之鸩,止孤独之渴。

🎯 板块

受益板块Where the tailwind lands

☁️

云厂商

实时在线 + 冗余算力预留的直接承载者,并发与网络需求抬升。

🗄️

HBM

降低延迟的核心硬件之一,带宽是"像人"的硬约束。

🔗

3.2T 光互连

延迟与并发双重驱动下,更高速率光互连受益。

◆ 说明

肯定有人会问股票代码——恕不能给。只能说从板块上看,云厂商、HBM、3.2T 光互连是最受益的方向。

相关阅读:美股热门板块大跌,怎么办? · 硅基城市 · ← 研究库