伴随AI编程工具从Copilot辅助升级到Agent自主模式,AI开始进入到企业工作流和办公场景,成为企业组织内部的“数字员工”。

去年这个时候,我们曾有个判断是:相较于销售、客服等领域,AI在编程领域的应用落地速度更快,且代码生成提效赋能开发者的场景已经被实践快速验证。如今,这种情况正因Agent的能力进化而有所改变:伴随AI编程工具从Copilot辅助升级到Agent自主模式,AI开始进入到企业工作流和办公场景,成为企业组织内部的“数字员工”。

与Agent功能扩张形成鲜明对比的,是企业用户在部署Agent存在的困惑:想要变成为企业确定性结果交付的执行者,不仅是技术挑战,更是组织惯性、隐性知识和成本回报的综合考量。

当写代码的Agent

抢了办公的活儿

就在上周,以Cursor、Anthropic、OpenAI为代表,先后对其AI产品进行了产品和功能迭代。这一做法,其实已经指向共同趋势:AI编程工具不再是开发者专用的编程IDE,它还是非开发人员在日常工作场景的工具。

Cursor正在由内部员工测试一款新产品,内部代号为“Sand”。这款产品的研发,与Cursor在2026年4月从SpaceX AI部门租用计算资源的动作密切相关。一位接近Cursor的人士透露,CEO Michael Truell在5月的全员大会上已明确表示,下一个增长机会在于“非开发人员的商业用户,且客户确实需要这类产品”。这是Cursor自2022年成立以来最重要的战略转向。

与此同时,Anthropic对其面向非技术人群的通用任务执行型Agent——Claude Cowork进行了重大版本更新,其核心变化在于,它从桌面端正式转为跨设备、全天候的运行模式。事实上,早在今年1月,Claude Cowork就以桌面版本推出引起业内关注。基于桌面端的Agent,意味着用户可以在本地执行任务和文件处理,AI可以更主动为用户提供服务,包括处理Excel数据、社媒信息获取等。

除了Anthropic之外,OpenAI也采取类似策略推出了一款名为ChatGPT Work的Agent产品,专为自主拆解多步骤复杂任务、跨应用收集上下文、长期运行并直接交付文档/表格/PPT/Web成品而设计。并且,OpenAI还计划将ChatGPT Work与Codex入口进一步进行合并。事实上,Codex最初被定义为AI编程工具,现在越来越多的非IT人士将其用于报告、电子表格、PPT、研究和数据分析。据上月最新披露数据,Codex周活用户已经超过500万。

这种能力的溢出,是编程模型的必然外延。“氛围编程”的提出者Andrej Karpathy曾揭示,当AI能通过对话理解并生成代码时,它本质上已经掌握了将模糊意图转化为结构化产出的能力。那么,将这种能力从结构严密的编程语言,迁移到同样遵循逻辑结构但更依赖模板的PPT制作、报表生成,在技术路径上同样存在可迁移甚至降维的空间。

同样在中国市场,从之前的Coding产品,到现在拓展到桌面端、聚焦工作场景,也出现了一批同类产品:阿里Qoder团队推出了Agent QoderWork、腾讯云CodeBuddy团队推出WorkBuddy、腾讯应用宝的Marvis、Kimi有Agent Kimi Work、字节有TRAE Work,此外还有智谱AutoClaw、阶跃的AI桌面伙伴、豆包专业版等等。我们还获悉,滴普科技也即将发布一款定位企业日常办公AI入口的Agent产品。

可以看到,现如今,办公Agent赛道已经有越来越多的产品涌入,无论是海外还是国内,在产品层面的探索,已十分活跃。

一位来自金融行业的技术总监梁文指出:“随着AI的发展,其他场景的使用量会逐步超过编码场景,只是现在还没有发展到这个阶段。因为目前使用AI的人大多还是程序员,可能最快到明年,就会有很多生产业务领域的AI使用量超过编码场景。”在这家企业内部,AI早已从早期的单点试点演进为公司级基础能力,研发、产品、业务、数据团队均有深度依赖,甚至部分业务流程离开AI支撑无法正常运转。

当然,新的挑战也同样存在,就像编程环境有编译器的即时校验,企业办公场景的校验则来自模糊的商业判断和审美偏好,但怎么定义好“审美”前者因人而异,后者则因企业各异。

成为“数字员工”,要先跑通流程

理解Agent还要先看Harness。Harness本质是Agent的运行时框架,即连接基础模型与真实环境的执行层,它决定了Agent能否感知环境、调用工具、执行命令并验证结果。

Claude Code的Harness设计原则是深度自主。Anthropic联合创始人Jared Kaplan曾在内部力排众议,坚持用真实世界脏代码而非竞赛题训练模型。其结果是,Claude Code的Harness擅长在遗留系统的“泥沼”中自主进行跨文件重构,其API调用量一年增长17倍。全球GitHub公开提交中约4%由Claude Code参与完成,Anthropic预计到2026年底这一比例将超过20%。但这种设计的代价是,可能会导致不可预知的操作风险,需要严格的人工审批流程。

Cursor则强调驾驶舱模式,其Harness体系更像是一个精心设计的辅助驾驶系统,深度集成在IDE内,强调用户对每一步的感知和控制。这种设计对前端开发和日常迭代极为友好,但在处理需要全局视角的后端复杂工程时,也就是说,Harness的自主决策能力是相对保守的。

我们注意到,被誉为中国版Codex的WorkBuddy,可能在构建一个更庞大、更复杂的Harness生态。它采用了SkillHub平台,通过封装超7万个技能的标准化接口,内置11款主流大模型从而实现智能调度。腾讯在依靠企业微信等腾讯系生态产品,以放大Agent的能力触达。但其挑战在于,由于企业办公场景的流程如报销、审批,远比编写代码环境更为模糊,且更依赖隐性知识。

何为隐性知识?网易智企·云信CTO徐杭生此前提到,编程可能更容易被取代,原因在于逻辑性太强、流程性太强。有规范,像软件工程一样,是有教学过程的。相反,没有教学过程纯靠经验积累的场景,是更难被取代的。

这种隐性规则的量化、建模与动态更新,是企业Agent落地的最主要障碍之一。

结合海外公司的策略来看,Anthropic通过Snorkel AI启动了代号为“Marlin”项目。该项目雇佣约1000名资深软件工程师,以每个任务280美元/1小时的报酬,对Claude Code的输出进行A/B测试和评审。他们购买的不是代码,而是工程师在审查代码时头脑中闪过的“这样写更好”的工程直觉判断。

为了真正意义上理解企业工作流,WorkBuddy采用了腾讯内部数万员工在使用其工具时产生的、经过脱敏和标注的真实工作过程数据,例如,一个优秀的市场方案是如何从提纲、素材搜集到初稿、反复修改成型的。

这种过程数据的获取在通用办公场景下极为困难,因为大量知识工作者的核心工作过程(如思考、决策)并不在数字工具上留下痕迹,这也是办公Agent相较于编程Agent存在的先天数据劣势。

效率不是终点

还要与真人比价值

我们此前报道过一个数据:在海外,企业集成Github Copilot后,编码时间虽减少50%,但Bug却增加了41%。这其实早已说明:在AI时代,一些老的效率标尺如代码行数、编码耗时已经很难衡量Agent价值,面向办公场景的Agent同样需要一套合适的衡量标尺。

Gartner在今年5月报告中指出,尽管90%的工程领 导者报告AI编程Agent带来效率提升,但平均净提升仅为19.3%,远低于产品宣传的“倍数级”效果。Stack Overflow调查显示,超过70%的开发者使用AI工具,但主要担忧仍是“代码质量难以控制”和“引入安全漏洞”。这意味着,在排除了调试、审查、沟通等非编码时间后,AI带来的真实组织效能增量其实没有想象中那么高。

梁文还注意到,现在很多硅谷企业存在的问题是,无法通过消耗更多Token,持续稳定地转化为新的需求,那么就会变成生产过剩。“所有人开始使用AI产品,并将其用在业务流中,并不能完全保证会为企业带来真正的业务增长。但这个过程中,很多过去非标准化、非结构化的流程或工具选项被固化由AI来完成,却又无法打开新的增量,这就可能带来裁员问题。”

这种转变意味着,Agent的价值必须投射到组织原有的业务价值流中,而非制造一套独立的AI效率数字。这要求企业重新设计从需求评审、代码审查到测试部署的全流程,让AI的参与可量化、可追溯,最终体现为业务响应速度的提升。

与此同时,当Agent全面进入企业流程,一个过去被忽视的问题正在被快速放大:Token消耗呈指数级增长,其成本可能很快超过被替代的人力成本。

国内某软件企业目前每个月Token的消耗量也已经到了几百亿。模型性能对Agent产品体验仍有重要影响,但当前最主要的制约因素,依然是高昂的Token成本。

今年6月,GitHub Copilot正式告别包月模式,改为按Token计费。有开发者测算,重度使用下月费可能从约50美元飙升至近3000美元。Gartner预测,到2028年,AI编程成本将超过普通开发者的平均薪资。

企业将像管理云计算资源一样,为不同难度的任务分配不同档次的模型,以实现成本最 优。国内某开发者社区一篇实战复盘显示,有团队将12名开发者的编码后端重定向至基于Claude Code协议的自定义工作流,通过混用不同型号模型,在提升32%效能的同时优化了预算。

不少技术人士不约而同提到了算力与模型管理这个话题,统一搭建算力网关,统一对内部的各个产品线进行模型供应商管理,以实现在成本、质量及稳定性方面的最 优组合。

为推动Agent项目更好落地,一些企业还采用了多Agent架构来执行不同任务,包括执行具体任务、数据查询、安全检查、性能监测等任务,Agent完成的任务更垂直、单一,对应的技术难度和复杂度也被分摊到了各个Agent上。

成本结构的正倒逼企业重新审视Agent的部署策略。过去,编程因为任务边界清晰、反馈闭环迅速,成为Agent落地的天然试验场,当Agent试图进入更广阔的企业办公场景时,需要解决的是更根本的问题。当Agent像一个合格员工一样Work时,你可能也不再关心Agent有多聪明,而是它的成本究竟值不值?

最新快讯

2026年09月02日

21:32
接棒巴菲特不到一年,伯克希尔·哈撒韦CEO格雷格·阿贝尔首次对外公开阐述公司的投资路线图。9月2日,他在CNBC《Squawk Box》节目中,详细回应了市场对集团近期投资的关切。 在谈及对谷歌的投资时,阿贝尔表示,伯克希尔从旗下企业清晰看到了人工智能的应用场景与收益潜力,而谷歌正是这一新兴领域的核心参与者。这笔约15个月前达成的100亿美元投资,最早由巴菲...
21:25
鼓狮财经9月2日电,伊朗议长卡利巴夫表示,美方必须履行相关承诺,随后伊朗才会采取行动重新开放霍尔木兹海峡。卡利巴夫当天在会见巴勒斯坦伊斯兰抵抗运动(哈马斯)官员时表示,伊朗不排斥谈判,但将谈判视为斗争的一种工具。卡利巴夫同时表示,在有关伊美谅解备忘录第一条的讨论中,伊方要求结束针对伊朗及其“抵抗阵线”盟友的战争,而对方最初提出的15条文本则要求伊朗全面停止导...
20:54
鼓狮财经9月2日消息,摩根大通私人银行全球投资策略主管格蕾丝·彼得斯表示,债券收益率的上涨已成为全球股市面临的主要风险。考虑到9月历来是美股表现低迷的时期,彼得斯指出,尽管今年美欧股市仍有进一步上行的潜力,但在11月美国中期选举等不确定性因素来临之前,市场可能会出现5%至8%的回调。不过,她认为这种波动属于健康的获利回吐,而非结构性崩盘。
20:31
据集微网报道,韩国政府进一步收紧了先进半导体领域的出口管制。自9月1日起,部分高性能人工智能芯片及先进半导体制造设备被正式纳入“战略物项清单”,韩国企业出口此类产品须事先获得政府许可。 此次政策调整依据是韩国产业通商资源部修订的《战略物项进出口公告》,该文件已于9月1日正式生效。修订过程中,韩国政府吸纳了国际出口管制机制约80项调整内容。此次修订不仅扩大了A...
20:31
百度正式完成在香港的双重主要上市,确立了其作为“全栈AI第一股”的行业标杆地位。这一举措不仅体现了李彦宏及团队在人工智能领域的长期投入与战略布局,也使百度更便捷地纳入“港股通”范围,进一步提升了其市场流动性与国际影响力。
20:22
鼓狮财经9月2日电,华大九天发布公告称,公司作为有限合伙人,将利用自有资金9000万元认购青岛建广顺创汇芯股权投资合伙企业份额。该基金总认缴规模为4.51亿元,重点布局半导体、移动通信、汽车电子、机器人与智能制造及物联网等前沿领域。此次投资意在深化产业链上下游的协同合作,共同推动国产EDA生态系统的建设。
20:22
鼓狮财经9月2日电,康盛股份(002418.SZ)发布异动公告。公司注意到近期媒体广泛报道了液冷产业的广阔前景及相关应用,指出该领域市场规模增长迅速。然而,公司澄清,其液冷业务目前仍处于市场拓展阶段,业务规模和行业占比均处于极低水平。此外,该业务毛利率偏低,整体处于亏损状态。数据显示,2026年上半年,公司液冷业务实现营业收入369.69万元,尚不足以对公司...
20:00
2026年8月28日晚间,地中海度假集团正式向港交所递交主板上市申请。若市场仅将其简单视为Club Med的资本回归,未免低估了此次递表背后的深层内涵与战略意义。 01 全球赛道定位:兼具高纯度与稀缺性的度假村龙头 地中海度假集团正以Club Med为核心品牌,在全球运营高端一价全包度假村,并同步向外输出超级度假区、文旅目的地等全套度假服务能力。其定位正从单...
20:00
最近,一个略显刺耳却极具吸引力的网站在网络上迅速走红,名为AI2027.com。该网站全球可访问,内容完全免费。其作者丹尼尔·科科塔伊洛曾是OpenAI的治理、预测与安全专家。2024年4月,他放弃了价值近千万美元的期权,毅然选择离职。他离职的原因十分明确:担忧公司在通用人工智能(AGI)逼近之际,无法以足够负责任的态度处理相关风险,并拒绝签署限制言论的保密...
20:00
9月2日,南下资金净买入港股40.93亿港元。资金流向方面,友邦保险获净买入9.65亿,中际旭创获4.51亿,腾讯获3.36亿,MINIMAX和智谱分别获3.35亿和3.17亿,长飞光纤光缆获2.87亿。相反,阿里巴巴净卖出7.64亿居首,华虹宏力净卖出4.04亿,中芯国际、中国黄金国际、紫金矿业和建滔积层板分别净卖出2.62亿、2.55亿、1.56亿和1....