近期,Anthropic和OpenAI几乎同步推出了语音模式的重大升级,带来了显著的性能与体验飞跃。Claude在模型能力与工具集成上取得了长足进步,而OpenAI则通过全双工架构与桌面端部署,将语音交互推向了新的高度。

一、Claude语音模式大升级

在此之前,Claude的语音模式仅能运行Haiku模型。虽然能听懂指令,但在处理复杂问题时容易“翻车”。如今,Opus 4.8和Sonnet 5全系列模型均已接入语音模式,用户甚至可以在对话中途切换模型。系统会自动调用所选模型的最快版本,而非完整推理版,以保障流畅度。

值得一提的是,语音模式会默认加载用户上次文字聊天时使用的模型,实现了语音与文字上下文的无缝衔接。

在交互方式上,Claude提供了两种模式:Hands-free(持续监听自动回复)和Push-to-talk(按住说话松手结束)。

最为关键的升级在于“工具调用”。Claude现在可以直接连接Gmail、Google Calendar、Slack、Google Docs和Canva。用户只需口述,即可完成查邮件、排日程、读文档、发消息等操作。Anthropic产品经理Robert Bye举例道,用户只需说一句“帮我总结Slack过去几小时错过的消息”,系统便会自动执行。

技术上,语音工具调用与文字聊天共用同一套Connectors架构,每次调用前都会征求用户许可,确保安全。所有套餐均可使用,但免费用户仅限Haiku模型及一个连接器。

语言支持方面,Claude新增了11种语言,包括英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、巴西葡萄牙语、拉美西班牙语和欧洲西班牙语。遗憾的是,中文并未包含在内。用户需手动切换语言或主动要求切换,否则默认为英语。此前有开发者从代码中发现的18种语言列表中,中文一度存在,如今却直接被移除。

二、ChatGPT Voice杀入桌面

相比之下,ChatGPT语音模式从底层换用了全新的全双工架构——GPT-Live。所谓全双工,是指模型能够同时处理输入和输出音频流,每秒做出几十次判断,无需等待用户说完即可回应。因此,GPT-Live会在对话中途自然地发出“嗯嗯”、“明白了”等反馈,极具拟人感。

该架构采用双层设计:前台是一个轻量级低延迟模型,负责实时对话、轮次管理和打断响应;后台则是GPT-5.5,负责复杂推理、网页搜索和Agent任务。当遇到需要深度思考的问题时,GPT-Live会将任务异步委派给后台的GPT-5.5,自身则继续与用户对话,待结果生成后再汇报。这种“委派推理”机制彻底解耦了对话延迟与推理深度。用户可调节推理深度档位:Instant(最快)、Medium(中等)和High(深度),分别对应GPT-5.5的不同能力。

性能测试显示,这一架构效果显著:GPQA(专家级科学推理)准确率从45.3%跃升至84.2%;BrowseComp(Agent网页搜索)从0.7%飙升至75.2%;在模拟真实电信客服场景的τ³-Voice基准测试中也全面领先。

依托这套底座,ChatGPT Voice正式登陆macOS和Windows桌面端。用户可设置全局快捷键,在任意应用中一键唤起。macOS版本还支持Appshots功能,ChatGPT可直接读取当前活跃窗口内容作为上下文。例如,用户对着Excel说“帮我计算Q3同比”,它能看到表格内容。此外,语音模式下可指挥ChatGPT Work和Codex中的多个Agent并行工作,一边写代码一边查文档,无需切换界面。

目前,该功能仅对Plus、Pro、Business、Edu和Enterprise套餐用户开放。

三、十秒钟就能感受到的差距

在短短十秒的对比中,两者的差异便显而易见:

* **打断能力:** Claude语音采用轮流制,用户说完后它才思考回应,想插嘴只能等待。而GPT-Live支持打断,用户可在说话中途随时更改主意,系统会无缝衔接。
* **多任务处理:** Claude语音一次只能处理对话,无法分心。GPT-Live在桌面端可同时进行语音对话,并后台操控电脑、指挥多个Agent并行工作,实现真正的多线程。
* **桌面控制:** Claude语音通过连接器调用SaaS工具,但无法触碰用户桌面。GPT-Live配合Computer Use,可直接操控文件、程序和终端。
* **推理深度:** Claude语音运行的是Opus的最快版本,而非满血推理版。GPT-Live的High档位可异步调用GPT-5.5 Thinking进行深度推理,在语音场景下反而能发挥更强的智力水平。

四、连输入框都不需要的时代

至此,两家公司的技术路线已分道扬镳。Claude主打个人生产力,利用用户的Gmail、日历等工具,帮助理清个人事务,门槛较低。OpenAI则走得更远,通过全双工和多Agent能力,打造了一种像真人交流般的极客体验,要求用户具备一定的任务管理能力。

正如OpenAI联合创始人Greg Brockman所言:“比起语音,打字这件事本身就特别不自然。”或许正如他所预言,那把陪伴了人类四十年的物理键盘,正被这两家AI巨头同时推向墙角。

最新快讯

2026年07月24日

15:51
过去45天,Anthropic几乎没停过手。Fable 5和Mythos 5同时落地,Sonnet 5降价抢市场,Claude Code几乎日更。昨天Cowork刚迭代完,今天Anthropic又在托管智能体平台(CMA)上一口气推出了六项更新:技能上限从20拉到500:一个会话装下整座企业知识库思考力度五档调速:简单路由省token,深度...
15:51
“从全球范围看,AI 编程已过了技术陡峭期。但二级市场退烧后,产业一线开始了近身肉搏。”一家国内头部券商计算机资深分析师张淼告诉雷峰网。最近,AI 编程市场又火了起来。海外,Anthropic、OpenAI 为抢用户,激烈火拼,不断加码免费额度与体验时长,打起了额度战。国内,战火一路从用户心智烧到商业底牌:阿里宣称AI编程市占率第 一,智谱...
15:38
具身智能还没走进客厅,运动装备却率先“赛博化”了。 如今的山海之间,最能吸引眼球的早已不是烂大街的始祖鸟冲锋衣,而是充满机械感的“赛博腿”。在小红书等社交平台上,当博主们晒出穿戴外骨骼徒步的照片时,那种人机融合的未来感分分钟引爆流量。 户外博主阿泽对此深有感触。去年10月,他接到某国产户外品牌的体验推广合作,穿戴新款智能外骨骼设备,完成...
15:38
7月23日中午,美国费城宾夕法尼亚会议中心,2022年菲尔兹奖颁奖典礼现场,四位新科得主——邓煜、John Pardon、Jacob Tsimerman 和王虹——并排就座。邓煜与王虹的获奖,标志着中国籍数学家首次问鼎这一数学界的最高荣誉。而在众人瞩目下,多伦多大学教授 Jacob Tsimerman 突然宣布了一项令人震惊的决定:他将投身于“AI安全”领域...
15:38
过去,搜索引擎也会抓取内容平台上的文章、回答和网页信息。 但搜索引擎通常只提供标题、摘要和链接。当用户想要获得完整内容时,仍然需要点击链接,进入内容最初产生的平台。 搜索引擎抓取了内容,也把用户送了回来。 现在,大模型同样从互联网获取内容,却可能在自己的界面中完成检索、总结、改写和回答。用户提出问题后,直接得到一份完整答案,已经没有...
15:38
7月24日,A股主要指数震荡下行。上证指数下跌1.61%,收报3814.2点;深证成指下跌2.47%;创业板指下跌2.65%;北证50指数跌幅最大,达4.03%;科创50指数微跌0.14%。当日两市成交额为19447亿元,较前一交易日减少2651亿元。全市场超过4900只个股下跌,市场整体情绪偏弱。 **板块表现** **下跌板块:** 盘面上,多数板块回调...
15:38
在全球科技股剧烈震荡的背景下,知名投资者段永平近期对投资组合进行了调整。他在社交平台上回应了一位网友的提问,该网友猜测他可能为了买入SpaceX而减仓泡泡玛特。段永平澄清说,他实际上才刚刚开始买入泡泡玛特,并预计在十年内都不会卖出。他透露,苹果的持仓已经相当成熟,近期被看涨期权行权套现了一部分,资金转投了美国短期国债。虽然目前的国债价格略低于行权价格,但他并...
15:21
7 月 23 日,腾讯宣布混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由腾讯首席 AI 科学家姚顺雨管理,以进一步提升模型研发和协同效率,探索全模态模型的智能上限。以大语言模型为基础,腾讯混元构建了图像、视频、语音、3D 生成模型等完整的模型矩阵。2026 年以来,腾讯混元模型迭代速度不断加快,与腾讯公司业务的协同也持续增强...
15:07
据鼓狮财经7月24日报道,东京电力公司已正式结束本年度福岛第一核电站的第三轮核污染水排海作业。本轮实际排海总量约为7900吨,较东电此前预计的7800吨略有增加。根据7月2日该公司公布的数据,本轮排放水中含有的放射性氚总量约为1.3万亿贝克勒尔。自2023年8月起,日方无视国际社会的强烈反对与质疑,单方面强行启动了核污染水排海计划。
15:07
2026年的WAIC上,机器人虽依旧占据大量镜头,但展馆里增长最快的却是那些自称“AI基础设施”的公司。展馆里不少是熟面孔,无论是做液冷、交换机、存储还是集群软件,今年名片上多了一行“AI基础设施”。资源对接平台也向此靠拢,产业链各环节似乎都在向更靠近用户入口的位置移动。逻辑不难理解:大模型应用变现路径尚不明朗,给AI“卖铲子”似乎成了更确定的生意。然而,走...
15:07
人工智能(AI)正迈入新一轮资本开支周期。高盛的最新报告指出,AI投资的重心已从模型研发转向更广阔的实体经济领域。在算力、电力和数据中心持续高速建设的同时,AI正加速渗透至制造、能源、物流、国防、生命科学及机器人等现实场景。高盛预计,2026年至2031年间,全球围绕计算、数据中心和电力的AI资本开支将达到约7.6万亿美元。 中国也正快速融入这一轮AI基础设...
15:07
清华大学团队研发的AutoMIA系统,能够将任意两张图片转化为具有镜像错觉效果的3D艺术品。该系统不仅支持正面与镜中呈现截然不同的图案,还具备3D打印功能。请看下面两组照片:每一组中,左侧是镜子前物体的正面图案,右侧则是其在镜中的倒影。令人惊讶的是,正面与镜中呈现出的几乎完全是两个毫不相干的东西——第一组正面是「CVPR」,镜中却变成了「2026」;第二组正...