智能手机统治了过去十几年的数字生态,它是注意力的黑洞,也是我们最私密的随身之物。但手机从设计之初就是为“人盯着它”而生的——它的全部逻辑,都止于屏幕。AI 的需求却恰恰相反:它需要持续感知物理世界——见你所见,听你所闻,随时在场,而非等你解锁屏幕才醒来。当 AI 真正成为一种基础能力,它迟早要从屏幕里破壳而出,寻找属于它自己的形状。这将是一个漫长的探索和演化过程。

“AI 器物志”栏目由此而来,爱范儿想和你一起持续观察:AI 如何改变硬件设计,如何重塑人机交互,以及更重要的——AI 将以怎样的形态进入我们的日常生活?这是该栏目的第 19 篇文章。

过去两年里,AI 最明显的变化不只是模型变聪明,而是它的定位从少数人的专业工具,转变成了日常生活的基础能力。如今,我们更是习惯了在走路、开车、做饭甚至摸鱼期间,随时随地向 AI 发出指令。

只不过随着频率提高,以 PC 时代键鼠交互为主的人机交互方式正在逐渐暴露出短板——“手动打字”需要用户先有一个想法,再将散乱的思绪组织成连贯语言,还要在叙述中保持一定的逻辑关系,才能将脑袋里想的变成 AI 能够理解的提示。

而在键盘的另一边,手机时代所主导的“语音输入”就几乎没有这样的桎梏。毕竟讲话和打字最大的区别,就是语音允许人们一边输出,一边思考、补充和修正,相比键盘输入更接近思维原本发生的方式。

此外,语音输入不需要稳定的桌面环境,也不要求用户持续低头,更不用优秀的文字表达能力——对于绝大多数没有受过系统写作训练的普通人来说,语音远比文字输入更接近“真正的自然交互”。

这种广泛的需求之下,自然也催生出了一批围绕语音入口展开的产品。比如势头正盛的 Plaud,主打的就是将录音、转写和总结包装成完整工作流;成为样板产品的 Typeless 则负责删除语气词、进行格式清洗后“帮你成文”。诸如光帆 Lightwear 之类的可穿戴设备则更进一步,试图整合出一条传统智能手机之外,全场景的完整 AI 使用流。

这些产品的形态各不相同,押注的却是同一件事:下一代 AI 入口,未必要求用户坐下来、打开应用并认真打字。

“自然语言交互”听上去非常先进,但它先进的地方其实是沟通效率,技术原理上并没有什么惊天地泣鬼神的地方。

门槛最低的方案,就是一副 TWS 耳机加手机上的 AI,就能组成一个 24 小时在线的虚拟副手。毕竟耳机本来就在耳朵里,手机系统与第三方 app 也有现成的语音转写、快捷指令和跨应用输入。不需要任何专用硬件,就可以把你散碎的命令传达给任何一个 AI 模型。

而且,它的速度、兼容性和跨设备能力,仍然优于市面上大多数号称“开创先河”的专用 AI 硬件。

然而现实情况是,这套近乎无门槛的组合,真正的瓶颈不在手机、而在麦克风对环境人声的处理。就拿 AirPods 为例,由于 AirPods 的麦克风策略强调声音自然度、不愿意给人声降噪,在多人环境里经常会出现将周围说话的声音一并采集到转成文字的问题。这对于打电话或者发语音没什么,但对于 AI 输入,一旦提示词“夹生”,就很容易得到完全不相关的回答。

相比之下,国产品牌的 TWS 耳机普遍采用了更激进的人声隔离策略,牺牲了一些通透模式自然度,换来了电话和 AI 语音期间更好的准确率。

如果往更深层看,这意味着在 AI 成为“主流使用场景”的当下,耳机好坏的评价标准正在改变——过去耳机比的是音质、延迟和降噪,未来除了前面这些,更要比较人声降噪的强度、准确性和分离能力。甚至我们可以说,耳机麦克风正在从逐渐被人遗忘的通话配件,一举变成了最前端的 AI 控制器。

语音指挥的第二条路线,则是智能眼镜。尽管智能眼镜总是强调“给人生加上一块 HUD”,但从商品化结果来看,唯一成功的智能眼镜仍是以语音、拍照和开放式音频为核心的基础款。这背后的原因倒不复杂:眼镜显示系统会牺牲重量、续航和成本,更需要从 0 培养一套全新的用户使用习惯。而“看见什么问什么,AI 讲给你听”,本身就足够构成一个相对清晰的 AI 卖点。

但智能眼镜的问题在于,它的“无感”更多存在于宣传片里。毕竟当一副带摄像头的眼镜持续朝向别人时,对方很难判断设备是否正在拍摄或者收音,这种不确定性本身就会制造社交压力。再加上受限于体积和续航,智能眼镜的麦克风阵列、通话降噪和扬声器效果,不一定比成熟的 TWS 耳机更好。

更重要的是,在目前智能眼镜的销售模式中,这类产品往往与品牌客户端和云端模型深度绑定,用户在模型选择、数据迁移和跨设备切换方面缺乏自由度。最简单的例子就是 Meta。Meta Ray-Ban 智能眼镜在各个方面都比较平衡,却强制用户连接 Meta AI,不能作为蓝牙音频设备直接唤醒 Siri 或者其他智能助手。这种程度的绑定让智能眼镜虽然成为了“语音 AI 交互”的代表性产品,却很难成为那个主流产品。

第三条路线,则是 2026 年以来逐渐兴起的道路——为语音输入 AI 制造独立硬件入口。比如刚刚 OpenAI 与 Work Louder 联名的 Codex Micro,就是一块面向 AI 智能体的外置控制台。并且上面专门设置了一个用于语音输入的 push-to-talk(PTT)按键:尽管 Codex Micro 本身没有麦克风,PTT 需要调用电脑连接的其他收音设备,但这种设计依然具有象征意义:语音输入已经不再只是 UI 中的一个小图标,而开始逐渐获得类似鼠标右键、手机拍照键或者键盘指纹一样的稳定的物理位置。将语音输入单独作为一个按键设置,基本上承认了这种 AI 交互方式的高频属性——甚至对某些用户可能比 26 个字母键都要更高频。

PTT 更进一步的设想,就是彻底摆脱屏幕。爱范儿之前爆料过,OpenAI 正在规划的若干硬件产品中,就包括一个无屏的便携设备,通过语音、摄像头和环境传感器理解用户所处的情境。如果 OpenAI 真的这样设计,无异于承认了曾经 Humane AI Pin 的道路。当然,背后有 ChatGPT 和 Codex 做背书,OpenAI 的徽章肯定会比 Humane 的更实用。

与此同时,面对 AI 语音交互最难绕开的两个问题:公共场合说出个人安排的尴尬,以及嘈杂环境中的识别失真,研究者们也有了一些奇思妙想。比如近期出现的一些“超声波舌部动作识别”设备,通过抵在下颌的超声波探头读取舌头运动,再用机器学习将其解码为语言;另一些研究则尝试把传感器装进眼镜或头显,通过面颊、颧骨和口部的细微运动识别无声指令——之前被苹果悄悄收购的 Q.ai 就是研究这个方向的。

这些装置距离消费级产品仍然很远,识别范围、准确率和佩戴体验也存在明显限制,但方向已经足够清晰。未来的“语音输入”未必真的需要发出声音——所谓语音交互,最终可能演化为对人类发声动作、口型乃至面部肌肉活动的直接识别。

归根结底,为什么语音输入能够在 AI 时代获得超越键盘的声望,还是因为人类不是纯粹的“视觉动物”。换言之,人们虽然习惯于用眼睛接收信息,但并不擅长用视觉信号发送信息。在传递信息这件事上,我们仍然遵循着 30 万年前的习惯:发出“咕咕嘎嘎”的声音就是要比打手势效率高。

用语音指挥 AI,看似是一种相对低效的使用方式——人在讲话时经常重复、跑题,表达也很难称得上精炼。但它最大的特点,就是消弭了 AI 的工具感。无论用户潜意识里把 AI 当作下属、秘书还是同伴,以对话作为交流媒介,始终比填写命令框更接近人类本源的协作方式。

然而“语音交互”虽然便利,这种便利的隐性成本也在上升。传统 STT 工具只负责把声音转换成文字,最终模型用来计费的只有转换后的文本输入与输出 token;而 Typeless 之类的“文本清洗”工具还要额外调用模型,对口语进行整理和改写,再把整理后的内容发送给另一个 AI,中间又叠加了一层 token 消耗。

而当各家的多模态模型进入“原生音频”的阶段之后,由于需要持续处理声音、上下文、语气、打断和输出,一个工作阶段内的 token 消耗量往往是纯文本的 10 倍或更高。虽然与高清图片和视频处理相比,语音处理的总 token 成本依然不算离谱,但它已经不再是一个可以忽略的附属功能。

尤其在长时间实时对话中,用户很难像输入文字那样主动控制信息长度,模型却必须持续维持连接、理解上下文并生成反馈。这就导致 AI 语音交互越自然,背后的计算过程反而越复杂,用户最终的消费成本也就更高。这一点几乎成为了最近 AI 厂商们的一种“阳谋”——毕竟鼓励语音交互一方面好处多多,另一方面更是将 token 消耗量推上一个新台阶,没有厂商会和收费过不去。

因此,对于模型厂商以及配件品牌来说,未来 AI 业务的竞争不只是能不能听懂人话。更关键的是,谁能以更低延迟、更少冗算和更透明的计费,调和好不同模态业务之间巨大的成本差异。毕竟让人们开口对 AI 讲话并不难,真正难的是让人们想要一直说下去。

最新快讯

2026年07月22日

22:56
鼓狮财经7月22日电,奥比中光(688322.SH)发布公告称,公司正在筹划在香港发行H股股票并计划在联交所挂牌上市。这一举措旨在深化全球化战略布局,构建国际化资本运作平台,同时拓宽多元化的融资渠道。目前,相关具体细节尚未敲定。值得注意的是,本次H股发行不会导致公司实际控制权发生变更。后续,该方案尚需提交董事会及股东大会审议,并需获得中国证监会及香港联交所等...
22:25
7月22日,鼓狮财经报道,恩捷股份(002812.SZ)发布公告,宣布拟采用集中竞价交易方式回购公司股份。本次回购金额不低于1亿元且不超过2亿元,回购价格上限为93元/股。 公告指出,回购的股份将用于实施股权激励计划或员工持股计划。回购期限自董事会审议通过之日起六个月内。
22:25
鼓狮财经7月22日讯,容百科技(688005.SH)披露了2024年半年度报告。数据显示,公司上半年实现营业收入87.21亿元,同比增长39.57%;归属于上市公司股东的净利润达到1.09亿元,成功实现扭亏为盈。 业绩回暖主要得益于海外客户订单放量、三元及钠电正极材料销量增长、磷酸锰铁锂产品满产满销,以及原材料价格上涨带来的成本传导。财务数据显示,第二季度单...
22:24
【热点】华电辽能澄清不涉及算电协同项目;立新能源表示无算力产业相关业务布局 【项目投资】金安国纪拟20亿元投建珠海国纪增资扩产项目;奥海科技控股子公司拟投建智新控制研发中心及生产基地 【业绩预告】南网数字预计上半年净利润同比增长1051.24%至1511.74%;奥浦迈预计上半年净利润同比增加约229% 【中标合同】平治信息预中标3亿元算力服务采购项目;许继...
22:17
《科创板日报》7月22日讯,继澜起科技与普冉股份之后,佰维存储成为本月第三家宣布回购方案的存储企业。7月22日盘后,佰维存储发布公告,由董事长孙成思提议以集中竞价交易方式回购公司股份。回购资金总额拟定为2亿元至2.5亿元,价格上限设定为不超过董事会决议前30个交易日均价的150%,或不超过558.44元/股。佰维存储强调,此次回购旨在维护公司价值和股东权益,...
21:52
7月22日,据鼓狮财经报道,东北制药(000597.SZ)发布公告称,公司已正式收到国家药品监督管理局核准签发的《化学原料药上市申请批准通知书》,获批生产玛巴洛沙韦原料药。该药品为抗流感病毒药物,主要适用于成人和儿童流感患者。此次获批将有助于丰富公司产品管线,增强市场竞争力,但具体投产销售时间及实际销售情况仍存在不确定性。
21:52
鼓狮财经7月22日讯,长江证券(000783.SZ)发布公告,董事长刘正斌提议使用公司自有资金,通过集中竞价交易方式回购股份。本次回购金额不低于1亿元,不超过2亿元。回购资金将主要用于实施员工持股计划、股权激励,或用于维护公司价值及股东权益。
21:51
7月21日至22日,国务院国资委举办中央企业负责人研讨班。会议强调,要高质量实施新一轮国资国企改革方案,推动改革工作向纵深发展。 在改革重点上,会议提出明确要求:在主业管理方面,需进一步优化企业功能分类;在重组整合方面,要确保新组建企业起步即加速。在深化公司治理方面,要加强党委(党组)前置研究的实质把关,差异化完善二、三级子企业董事会建设;同时要强化经理层成...
21:51
今日,多家A股公司密集披露2026年半年报及业绩预告,业绩表现亮眼。其中,益生股份净利暴增近49倍,联讯仪器、南网数字净利最高预增均超9倍,中微半导净利增逾九成,贝达药业、奥浦迈等公司亦有预增公告。 以下是详细情况: 益生股份:上半年净利同比增4897% 公司公告称,2026年上半年实现营业收入16.97亿元,同比增长28.44%;归属于上市公司股东的净利润...
21:15
鼓狮财经7月22日讯,好上好(001298.SZ)发布公告称,公司于7月22日收到深交所上市审核中心出具的审核中心意见告知函。深交所审核确认,公司符合发行条件、上市条件及信息披露要求。目前,公司后续将向证监会履行注册程序。值得注意的是,该事项尚需获得证监会的同意注册,最终结果仍存在不确定性。
21:15
据鼓狮财经7月22日报道,保加利亚议会当日通过表决,批准美军在2026年7月24日至10月1日期间,于贝兹梅尔空军基地驻扎。具体部署内容包括最多8架美国空军KC-135空中加油机及其机组人员、最多250名配备个人武器的士兵,以及相关机场设备。 7月21日,保加利亚外交部证实已收到伊朗驻保加利亚大使馆发出的外交照会,内容涉及美军可能在该基地部署加油机一事。对此...