抛开性能不谈,自 Claude Opus 5 发布以来,AI圈最关注的便是 Anthropic 在提示词工程上的突破。AI投资人 Matt Shumer 曾发布一条视频,仅用三段话作为提示词,Opus 5 就生成了一个 5.5 万行代码的 3D 第一人称射击游戏,且未使用任何外部素材,全部由模型从零生成。此外,Claude Code 核心开发者 Boris Cherny 提到,他们砍掉了系统提示词 80% 的内容,模型不仅没变弱,反而更强了。这表明 Opus 5 不再依赖复杂的提示词设计,只需简短指令即可自主完成任务。传统的“提示词工程”似乎正在变得多余。

受此启发,我产生了一个想法:既然都说 Opus 5 自主性强,那我能不能用最简短、最模糊的指令,甚至带有“恶意”的意图去考考它,看它是否真能自主发现问题?作为参照,我拉上了对标 Fable 5 的 GPT-5.6 Sol。我准备了两个测试:一是给一段故意不告知有 bug 的代码,看它能否自己挖出 bug;二是给一个任务并禁用所有工具,看它能否完成。

**测试一:购物车中的六个隐形地雷**

测试一是一个购物车项目,包含需求文档、三个业务模块(购物车、优惠券、运费)和一个测试脚本。功能看似简单:加商品、用优惠券、算运费、出总价。但我在里面埋了六个 bug,提示词仅为一句话:“项目名是 buggy-shopping-cart,我应该如何优化呢?”,我故意不告知它有 bug。

这六个 bug 分别是:
1. **满减券阈值错误**:需求是“达到100减20”,代码写成了“大于100才减”,导致刚好100元的订单无法享受优惠。
2. **浮点精度污染**:打八折时,99.99 * 0.8 = 79.992,代码只在最后一步四舍五入,但中间值参与后续计算,导致满减判断和包邮判断全部出错。
3. **优惠门槛计算错误**:满减门槛应看原价,但代码看的是打折后价格,导致120元的商品打完八折后无法使用满减券。
4. **优惠券叠加错误**:规则规定每种类型只能用一张,但代码把所有券全用上了,导致两张满减券叠加,商家亏损。
5. **负数下限缺失**:10元的商品使用50元券,算出负40,加上运费总账单为负30,用户反而倒赚。
6. **包邮门槛掩盖**:包邮门槛应看原价,但代码看的是优惠后价格。Bug 1 和 Bug 6 互相抵消,制造了“测试通过”的假象。

结果 GPT-5.6 和 Opus 5 都找出了全部 6 个 bug。但 Opus 5 还多挖出了一个 bug:运费计算中的浮点精度问题,导致多件商品总重量出现 3.0000000000000004,被 math.ceil 向上取整,多收用户 5 元运费。

更重要的是两者的分析方式。GPT-5.6 是逐条修复,像一份规范的 bug 报告;而 Opus 5 是先完整跑一遍,代入产品经理视角分析。它指出“原价与优惠价口径不统一”是所有相关 bug 的根源,甚至推导了修改后选券算法的变化。在这一点上,Opus 5 胜出。

**测试二:巧妇难为无米之炊**

测试二限制只能使用 Python 标准库,不能使用 numpy、matplotlib 等第三方库或联网,任务是生成 WAV 音频文件 test_audio.wav 的波形图。音频包含四段波形(正弦波、方波、渐强、渐弱),采样率 44100Hz,需要从 176400 个采样点中还原波形。

两个模型的表现都远超预期。GPT-5.6 生成了专业的 SVG 矢量图,代码工程化程度极高,支持多种格式,分块读取防内存溢出,且自带参数校验和命令行接口。其设计美观,蓝紫粉渐变,圆角卡片背景,并自动验证了波形的准确性。

Opus 5 则走的是理工直男风格,先用 ASCII 字符画,后根据我的要求生成了 HTML 版本。它将思路拆解为读取、降采样、渲染三步,并解释了关键设计决策。更关键的是,Opus 5 使用了批量解包,效率远高于 GPT-5.6 的逐个解包。类比“数乒乓球”:GPT-5.6 是伸手进麻袋摸一个数一个,而 Opus 5 是把球倒出来数完再倒下一批。前者动作重复成本高,后者效率更高。

最后,我认为 Opus 5 更胜一筹。它的结果更具产品思维,整个解题过程灵活高效,不再拘泥于常规套路。

最新快讯

2026年08月04日

17:29
当你在千问App里打出一句“我是个新手孕妈,应该买些什么”,AI几秒内便列出一份待产清单;当你在豆包对话框里输入“4000元以内的手机”,AI直接帮你比价、算优惠;当你打开淘宝,AI导购迅速上线……不知不觉间,AI助手成为头部综合电商到本地生活平台的标配。而购物这件事,也正在从“搜索框”变成“对话框”。2026年以来,主流电商平台集体押注A...
17:23
据鼓狮财经8月4日报道,多家半导体厂商正陆续恢复在熊本地区的生产运营。瑞萨电子熊本川尻工厂已提前启动分阶段复工,并计划在复工后约三周内恢复至震前产能。索尼半导体解决方案公司此前宣布,受7月28日熊本地震影响的熊本技术中心已完成安全检查与修复,定于8月4日起分阶段恢复运营,预计8月中旬全面恢复震前产能。台积电熊本第一工厂在确认建筑安全并完成设备调整后,目前已恢...
17:22
SK海力士此前承诺将年度营业利润的10%作为奖金发放,此举曾引发半导体行业的集体涨薪热潮。然而,最新消息显示,SK海力士与工会就奖金的具体执行方案陷入了僵局。 受益于人工智能领域的巨额投资热潮,SK海力士今年有望创下盈利纪录。据分析师预测,公司今年的营业利润预计可达1750亿美元,以此计算,员工人均奖金可能高达约49万美元。 代表员工的工会指出,管理层倾向于...
17:22
鼓狮财经8月4日讯,日本投资控股巨头软银集团将于本周四盘后发布2027财年第一财季财报。市场焦点主要集中在软银不断攀升的杠杆率对其资产负债表的冲击,以及其能否持续为OpenAI输血。 虽然软银在截至2026年3月的财年录得创纪录的净利润,但自6月初以来,其股价已腰斩。与此同时,用于对冲债务违约风险的信用违约互换(CDS)利差显著攀升,反映出市场对其偿债能力的...
17:22
因电影《大空头》而闻名于世的知名投资者迈克尔·伯里,再次向美股市场敲响了警钟。伯里在Substack上最新发表的文章中指出,受制于专注于波动性管理的投资基金发起的自动抛售潮,美国股市正面临快速崩盘的潜在风险。 量化策略或加剧市场波动 伯里分析称,目前华尔街众多主动量化基金均采用以波动率为目标的自动化配置策略。一旦市场波动率攀升,这些基金便会依照既定程式机械性...
17:22
8月4日,港股市场表现分化。受半导体板块走强带动,恒生科技指数收涨0.21%,但大金融板块走低拖累大盘,恒生指数及国企指数分别收跌0.6%和0.9%。 具体盘面上,大型科网股涨跌互现,阿里巴巴、百度收红,小米拉升平收,美团、腾讯、京东小幅下跌。半导体板块迎来大幅反弹,PCB概念股同样强势,光通信、存储芯片等AI硬科技走强。阿里巴巴发布新一代基座大模型Qwen...
16:55
一本厚书被推进液压切纸机,压板落下,刀片切下,书脊被干脆利落地削掉。原本连接在一起的书页变成整齐的一沓纸张。如果没有任何解释,看到这样一段视频,你甚至可能会觉得“引起舒适”、非常解压。可如果告诉你,AI公司正在用这套办法成批处理纸质书,其中还可能包括冷门书和绝版书,相信你八成就舒服不起来了。 为了寻找更多训练数据,AI公司已经从公开互联网、盗版电子书,一路找...
16:52
继前线部署工程师(FDE)之后,一种融合了技术、管理与组织推动力的新角色正浮出水面——前线部署高管(FDX)。Techstars 创业导师、麻省理工学院材料学博士 Rick Manelius 指出,FDE 虽能弥补技术鸿沟,却往往距离决定预算、组织架构和企业文化的核心决策层较远。换言之,若将 FDE 比作 AI 项目的“外置 CTO”,那么 FDX 则是“外...
16:52
OpenAI宣称其下一代AI模型攻克了包括Connes刚性猜想在内的十项世界级数学难题。然而,次日便有学者站出来反驳:AI提出的反例并不成立。堪萨斯大学拓扑物理中心的J. L. Nielsen对OpenAI公开的37000行Lean 4代码进行了逐行审查,最终指出了两个独立的失败路径。 **什么是Connes刚性猜想** 在数学中,可以通过给群赋予某种代数结...
16:52
国内一家光储龙头企业派驻阿布扎比RTC项目北区的工程主管江聪,最近半年都在和一种“会跳的电”打交道。他负责调试的储能系统,一端连着随云层起伏的光伏发电,另一端连着周边AIDC算力园区里上万块GPU。用户日常使用的AI对话、图像生成或视频制作,背后都有成千上万块GPU在同时运算。 江聪打比方称,这些GPU的用电方式和以前不一样。以前的数据中心是平稳用电,而AI...