就在刚刚,Anthropic 和 OpenAI 不约而同地宣布了语音模式的大升级。Claude 模型阵容扩充至 Opus 4.8 和 Sonnet 5,不仅能通过连接器操作 Gmail、日历等工具,还新增了 11 种语言支持。而 OpenAI 则推出了基于全双工架构的 GPT-Live,直接支持多 Agent 并行指挥及中文,并正式登陆桌面端。
Claude 语音模式升级
在此之前,Claude 的语音模式仅限于运行最小的 Haiku 模型。你跟它语音聊天,它能听懂,但稍微复杂一点的问题就容易翻车。现在,Opus 4.8 和 Sonnet 5 全系列均已上线。用户可在对话中随时切换模型,系统会自动调用该模型的最快版本。上下文无缝衔接,默认加载上次文字聊天的模型。交互上支持“免提持续监听”和“按住说话”两种模式。最引人注目的是“工具调用”功能的增强,语音对话中可直接连接 Gmail、日历、Slack 等应用,实现听令办事,如自动总结 Slack 消息或发送文档摘要。技术底层沿用文字聊天的 Connectors 架构,每次调用前会征求许可。不过,Claude 这次仅支持 11 种语言(英语、法语、德语等),并未包含中文。系统不会自动检测语言,用户需主动指定。此前开发者曾从代码中发现包含中文的 18 种语言列表,如今被砍至 11 种。
ChatGPT Voice 杀入桌面
相比之下,ChatGPT 语音模式采用了全新的底层架构——GPT-Live。这是一种全双工模型,能同时处理输入输出音频流,每秒做出几十次判断,无需等待对方说完即可回应。其采用双层架构:前台负责实时对话和打断,后台由 GPT-5.5 处理复杂推理和网页搜索。这种“委派推理”机制将对话延迟与推理深度彻底解耦,推理深度分为三档。基准测试显示,其专家级科学推理能力(GPQA)从 45.3% 跃升至 84.2%,网页搜索能力(BrowseComp)更是从 0.7% 飙升至 75.2%。在此基础上,ChatGPT Voice 正式登陆 macOS 和 Windows 桌面端。用户可设全局快捷键唤起,利用 Appshots 功能读取当前窗口内容,甚至能语音指挥多个 Agent 并行工作,如一边让 Agent 写代码,一边让另一个 Agent 查日志。
10 秒钟就能感受到两者差距
能否打断
Claude 是轮流制,必须等你说完它才想,想插嘴?等着。GPT-Live 支持打断,对话中途可随时插嘴。
能否一心多用
Claude 一次只能语音聊天。GPT-Live 可在后台操控电脑、指挥多个 Agent 同时干活。
能否动手
Claude 仅能操作 SaaS 工具。GPT-Live 配合 Computer Use 可直接操控桌面文件和程序。
想得有多深
Claude 虽有 Opus 4.8,但语音模式跑的是快速版,并非满血推理版。GPT-Live 高档位可异步调用 GPT-5.5 的深度推理能力。
连输入框都不需要的时代
看到这里,两家的分岔就清楚了。轮流制的 Claude,主打的是用你自己的 Gmail、日历、文档,帮你把自己那摊事理明白。全双工的 GPT-Live,主打的是像在跟一个人说话,可打断、可多线程、可操控电脑,让你忘记对面是 AI。
对不写代码的人来说,Claude 门槛低得多,有邮件要理、日程要排,张嘴就行。OpenAI 那条路更爽也更极客,你手里得先真有一队 Agent、有真活给它们干。正如 Greg Brockman 所言,比起语音,打字这件事本来就特别不自然。那把陪了人类四十年的塑料按键,如今正式被 OpenAI 和 Anthropic 同时逼到了墙角。
