抛开性能不谈,自 Claude Opus 5 发布以来,AI圈最关注的便是 Anthropic 在提示词工程上的突破。AI投资人 Matt Shumer 曾发布一条视频,仅用三段话作为提示词,Opus 5 就生成了一个 5.5 万行代码的 3D 第一人称射击游戏,且未使用任何外部素材,全部由模型从零生成。此外,Claude Code 核心开发者 Boris Cherny 提到,他们砍掉了系统提示词 80% 的内容,模型不仅没变弱,反而更强了。这表明 Opus 5 不再依赖复杂的提示词设计,只需简短指令即可自主完成任务。传统的“提示词工程”似乎正在变得多余。

受此启发,我产生了一个想法:既然都说 Opus 5 自主性强,那我能不能用最简短、最模糊的指令,甚至带有“恶意”的意图去考考它,看它是否真能自主发现问题?作为参照,我拉上了对标 Fable 5 的 GPT-5.6 Sol。我准备了两个测试:一是给一段故意不告知有 bug 的代码,看它能否自己挖出 bug;二是给一个任务并禁用所有工具,看它能否完成。

**测试一:购物车中的六个隐形地雷**

测试一是一个购物车项目,包含需求文档、三个业务模块(购物车、优惠券、运费)和一个测试脚本。功能看似简单:加商品、用优惠券、算运费、出总价。但我在里面埋了六个 bug,提示词仅为一句话:“项目名是 buggy-shopping-cart,我应该如何优化呢?”,我故意不告知它有 bug。

这六个 bug 分别是:
1. **满减券阈值错误**:需求是“达到100减20”,代码写成了“大于100才减”,导致刚好100元的订单无法享受优惠。
2. **浮点精度污染**:打八折时,99.99 * 0.8 = 79.992,代码只在最后一步四舍五入,但中间值参与后续计算,导致满减判断和包邮判断全部出错。
3. **优惠门槛计算错误**:满减门槛应看原价,但代码看的是打折后价格,导致120元的商品打完八折后无法使用满减券。
4. **优惠券叠加错误**:规则规定每种类型只能用一张,但代码把所有券全用上了,导致两张满减券叠加,商家亏损。
5. **负数下限缺失**:10元的商品使用50元券,算出负40,加上运费总账单为负30,用户反而倒赚。
6. **包邮门槛掩盖**:包邮门槛应看原价,但代码看的是优惠后价格。Bug 1 和 Bug 6 互相抵消,制造了“测试通过”的假象。

结果 GPT-5.6 和 Opus 5 都找出了全部 6 个 bug。但 Opus 5 还多挖出了一个 bug:运费计算中的浮点精度问题,导致多件商品总重量出现 3.0000000000000004,被 math.ceil 向上取整,多收用户 5 元运费。

更重要的是两者的分析方式。GPT-5.6 是逐条修复,像一份规范的 bug 报告;而 Opus 5 是先完整跑一遍,代入产品经理视角分析。它指出“原价与优惠价口径不统一”是所有相关 bug 的根源,甚至推导了修改后选券算法的变化。在这一点上,Opus 5 胜出。

**测试二:巧妇难为无米之炊**

测试二限制只能使用 Python 标准库,不能使用 numpy、matplotlib 等第三方库或联网,任务是生成 WAV 音频文件 test_audio.wav 的波形图。音频包含四段波形(正弦波、方波、渐强、渐弱),采样率 44100Hz,需要从 176400 个采样点中还原波形。

两个模型的表现都远超预期。GPT-5.6 生成了专业的 SVG 矢量图,代码工程化程度极高,支持多种格式,分块读取防内存溢出,且自带参数校验和命令行接口。其设计美观,蓝紫粉渐变,圆角卡片背景,并自动验证了波形的准确性。

Opus 5 则走的是理工直男风格,先用 ASCII 字符画,后根据我的要求生成了 HTML 版本。它将思路拆解为读取、降采样、渲染三步,并解释了关键设计决策。更关键的是,Opus 5 使用了批量解包,效率远高于 GPT-5.6 的逐个解包。类比“数乒乓球”:GPT-5.6 是伸手进麻袋摸一个数一个,而 Opus 5 是把球倒出来数完再倒下一批。前者动作重复成本高,后者效率更高。

最后,我认为 Opus 5 更胜一筹。它的结果更具产品思维,整个解题过程灵活高效,不再拘泥于常规套路。

最新快讯

2026年08月04日

16:52
继前线部署工程师(Forward Deployed Engineer,FDE)之后,现在又出现了一种兼具技术、管理和组织推动能力的新角色:前线部署高管(Forward Deployed Executive,FDX)。 ATechstars 创业导师、 麻省理工学院材料学博士 Rick Manelius 提出,FDE 能够弥补技术差距,却往往...
16:52
OpenAI宣称下一代AI模型解决了10个世界级难题,其中包括推翻了Connes刚性猜想。 第二天,就有一篇人类论文回应:AI提出的反例不成立。 作者是堪萨斯大学拓扑物理中心的J. L. Nielsen,他把OpenAI公开的37000行Lean 4代码从头追到尾,把每一个对象对回它的数学原型,最后给出两条互相独立的失败路径。 ...
16:52
国内一家光储龙头企业派驻阿布扎比RTC(全天候)项目北区的工程主管江聪,最近半年都在和一种“会跳的电”打交道。 他负责调试的储能系统,一端连着随云层起伏的光伏发电,一端连着周边AIDC算力(人工智能数据中心算力,俗称智算算力,区别于传统IDC通用算力)园区里上万块GPU(图形处理器)。 你每天用的AI(人工智能),背后有一套你不知道的电...
16:52
鼓狮财经8月4日电,韩国近日遭遇持续高温干燥天气,首尔市当地时间4日上午11时首次发布了最高级别的“高温重大警报”,并全面启动“停工、降温、关怀”三大紧急应对措施。韩国总统李在明4日在主持国务会议时表示,韩国正遭遇史无前例的极端高温天气,应将当前形势视为“国家灾害状态”,要求政府各部门全力采取各项应对措施,保障国民生命安全和正常生活。
16:52
8月3日,智元官网更新合伙人名单,熊彦、朱洁、张修征三位高管新晋进入核心管理层。至此,智元合伙人规模由7人增至9人。对此,智元方面对腾讯科技表示,此次管理层扩容旨在为公司下一阶段发展提供组织保障。 这次调整发生在智元业务加速转换的阶段。6月28日,智元宣布第15000台具身智能机器人下线,距离万台节点不到三个月。下线仪式现场,这台精灵G2被...
16:52
8月3日,阿里旗下企业级Agent产品“千问办公”正式开启公测。 阿里将千问办公定义为一站式AI办公平台,强调用户只需要描述目标,Agent便能拆解任务、调用工具,最终交付可以直接使用的文件和结果。它已经初步打通钉钉IM,下一步还将连接企业数据库和真实工作流。 千问办公由QoderWork、悟空和MuleRun三款产品全面整合而来,三款...
16:52
鼓狮财经8月4日电,Grab公布二季度净利同比大增620%至2.52亿美元;二季度营收从去年同期的8.19亿美元增至9.97亿美元,高于分析师预期的9.91亿美元,增长主要得益于配送、出行和金融服务业务营收增长。Grab预计2026年全年营收将介于41亿美元至41.5亿美元,高于此前预测的40.4亿美元至41亿美元。
16:52
“新员工加入是为了钱,而非使命。”这是 Anthropic 首席执行官 Dario Amodei 最近担忧的一件事。据外媒报道,这一消息是一内部人士曝出的。 几小时内这句话传遍各处,舆论一片哗然。经典的几条评论写道:“突发新闻:人们为了钱工作”,“本地男子发现了经济规律”,“他装得好像自己是义务劳动,不求任何报酬似的”。 而 Amode...
16:52
十大「菲尔兹奖级」成果,AI证明过程全公开了! 今天,OpenAI重磅放出一份长达62页的「核心手稿」,详细展示了GPT的完整推演。 官方终于「盖章」,完成这一惊人突破的,正是「下一代主力模型」。 若以GPT-5.6 Sol API计费标准算,烧掉的所有Token成本,仅2000美元。 AI证明手稿一出,全网再次被点燃了。...
16:52
鼓狮财经8月4日电,德国特种化工企业赢创公布2026年第二季度业绩:调整后息税折旧摊销前利润(EBITDA)同比增长24%,达6.3亿欧元;销售额同比增长11%,销量和销售价格均提升7%。净收益为8400万欧元,自由现金流为4900万欧元。
16:52
Claude这次,真把AI编程榜单打出断层了! 就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。 紧追其后的GPT-5.6 Sol,分数只有它的三分之一! 排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。 更让人意外的是,在...
16:51
鼓狮财经8月4日报道,随着科技创新债券(简称“科创债”)市场的持续扩容,各类支持新兴产业的“首单”产品频频涌现。在Token经济日益升温的当下,全国首单用于Token算力工厂的科创债近日成功落地。业内分析认为,具备低成本、短周期、长期限、大规模及稳定性等特质的外部融资渠道,将成为科技型企业的重要资金来源,科创债市场有望继续迎来扩容。 据无锡高新区科产集团官方...