试想一下,你利用 Claude Code 手写了一个小应用,并接入了一个 AI 客服。原本的设想是让它自动处理用户关于登录、会员服务等基础问题,让你实现“甩手掌柜”的愿望。然而,现实却很骨感:AI 虽然能聊天,但你却沦为了它的全职陪练。每当它回答不准,你就要补充提示词;解释太啰嗦,又要增加限制。更让人崩溃的是,每次修改提示词,你都得重新测试一遍常见问题,生怕顾此失彼,刚修好一个问题,又把原本答对的改坏了。结果,用 AI 写代码省下的时间,又被一轮轮的人工调试消耗殆尽。

针对这种反复调试的痛点,Anthropic 于 9 月 28 日发布了一份调优指南。这份指南的核心思路很简单:重复测试和修改这类繁琐的工作,Claude 也能干。让它多接手一些,你就能少当几轮苦哈哈的测试员,把更多精力投入到给 AI 把关上——即明确规则、界定什么是“做好”,并检查它是否真正做到。

要让 AI 有方向地改错,首先要明确“怎样才算做对”。平时我们总希望 AI 客服“靠谱一点”,但这太过抽象。如果能将要求落实到用户实际遇到的问题上,标准就会具体得多。例如:用户找不到导出按钮时,它能否给出正确的点击路径?用户问到未开发功能时,它是否会一本正经地胡说八道?遇到退款问题,它能否按规则处理,拿不准时不乱承诺?官方提供的第一个入口是 `/claude-api build-eval`。简单来说,它能帮你将这些具体要求转化为测试题,为接入 Claude 的小应用建立一套可反复运行的验收题库。

你可以把平时让 AI 频繁翻车的问题交给它,但题库不能只收录“翻车现场”,那些最常见、最普通的问题同样也要覆盖。否则,偏题、难题堆得再多,也可能测不准普通用户的日常体验。题目选好后,还要明确“怎么判分”。“专业”、“智能”、“友好”这些要求颗粒度太粗,要落实到更具体的衡量标准上。比如哪些信息必须说清楚,哪些错误不能犯,做到什么程度才算过关。Claude 会帮你拟出相应的评分规则,而你需要确认按这套规则拿到高分的答案,是否真的解决了用户的问题。有些结果可以直接用程序检查(如是否遗漏关键字段),遇到开放性问题,也可以让模型按明确规则打分。但评分器本身也要先过关。拿几份已经打过分的答案,对照自己的判断,看看有没有“答对了却扣分”或“没解决问题却给过关”的情况。确认评分靠谱后,再定期抽查。

题库建好了,接下来就是掏出第二个官方入口:`/claude-api hillclimb`。Hillclimb 可以理解为一种“爬山”算法,让 AI 一点点尝试优化,看看有没有进步。但这个 KPI 同样要具体,并明确允许它改什么。比如,让客服回答得更准一点,允许它修改提示词;或者在维持回答质量的前提下尝试省点 API 费用,允许它调整模型配置。接到任务后,Claude 会查看用于迭代的那些错题,每轮提出一处修改,再重新跑评估:在既定目标下确有改善,才保留修改;改完后反而退步了,就撤回。

按照官方文档,这两个入口都要求 Claude Code v2.1.259 及以上。提示词、技能文件、工具说明和模型配置等都可以成为调优对象,但具体改哪些,要由你划定范围。你可能会担心:AI 会不会变成应试教育的做题家?也就是只针对你给的那几道题死记硬背,换个问法又开始胡言乱语?官方也确实考虑到了这一点。这套流程会单独留出一部分题,作为不提前公开的“验收考题”。负责提出修改的模型看不到这些题的内容。每轮改完后,再用它们测试,看看效果是真的变好了,还是只对练过的题管用。如果练过的题分数涨了,“验收考题”的成绩却没提高,就可能出现了“过拟合”:越来越会做熟题,换一批题却没进步。遇到这种情况,Claude 会撤回本轮修改;如果改完后表现反而变差,也会回退。这能帮助发现“只会做熟题”的问题,但不代表从此高枕无忧。题库本身覆盖不到的真实问题,仍然可能让它翻车。

Anthropic 用一个内部客服评测展示了效果。在 14 张未参与指导修改的留出测试工单上,最终配置的决策准确率从 78.6% 升至 90.5%,提高了 11.9 个百分点,模型调用成本降到了原来的约 1/5。不过,这是一组特定配置、特定小样本下的结果,并不意味着接上这套流程,你的应用也能省八成。这里比较的模型调用成本,也不能当成整个项目的总成本。但对于自己掏腰包付 API 费用的个人开发者来说,仍然很有吸引力。毕竟便宜的模型如果老是答非所问,逼得用户反复追问,最后还要你人工介入,未必划算。而简单问题如果也用昂贵的配置,顺带生成一大段不必要的解释,同样可能花冤枉钱。现在,你可以把回答质量和调用成本放在一起测试,让 AI 在满足质量要求的前提下,尝试更省钱的方案。不过,调优本身也要消耗模型调用费用。先定好愿意掏多少实验费,再决定让 AI 跑几轮,才更踏实。

当这套自动化流程跑起来后,你就有机会少做一些重复的提示词修补,把精力放回产品本身。首先,是洞察用户。你觉得理所当然的操作,第一次打开应用的人可能连入口都找不到。你要做的,是把这些真实发生的困惑补充进题库,AI 的下一次优化才会更接地气。其次,是把控标准。回答再客气,没解决问题,能算过关吗?意思明明相同,只是换了种说法,评分器会不会误判?评分标准本身如果有漏洞,AI 忙活半天,可能只是分数涨了,用户的问题却还在。最后,是做权衡。回答精简会不会漏掉必要步骤?追求便宜会不会牺牲准确度?这些关乎用户体验的关键取舍,依然需要你来拍板。给应用接入 AI,初衷是为了省心。如果最后演变成你全天候陪着它改答案,就本末倒置了。当 Claude 能多接手一些重复调试,普通开发者就能多花时间打磨自己的小工具、小应用,让那些搁置的想法重新往前走。

最新快讯

2026年10月09日

12:17
10月9日早盘,粮食概念板块表现活跃,截至10:49,国证粮食产业指数上涨1.3%,成份股中,万向德农涨停,秋乐种业上涨8.3%。消息面上,世界气象组织近日发布消息,预计2026年10月至12月热带太平洋中东部海面温度将升至创纪录水平,厄尔尼诺预计12月达到峰值。厄尔尼诺往往带来大范围的异常气候,扰动主要产粮区的种植节奏与产量,全球农作物供给面临收缩压力,粮...
12:17
截至10月8日收盘,恒生科技指数报4073.38点,跌2.89%;港股通互联网指数报651.80点,跌1.66%;香港科技指数报1402.08点,跌2.84%。港股通今日恢复交易。从位置上看,开源证券统计,截至9月30日恒生科技指数年内累计下跌22.9%、9月单月下跌7.9%,主因美债收益率高企与互联网、车企盈利下行;9月港股日均成交1566亿港元,较近12...
12:17
当地时间10月8日,美国总统特朗普表示,美国正在与伊朗进行富有成效的会谈,且绝不会在11月3日美国国会中期选举前攻击伊朗。消息公布后,国际油价一度收窄半数涨幅,黄金迅速转涨、脱离两月低位。与此同时,美国财政部网站消息显示,美国对伊朗实施新一轮制裁,制裁对象包括17艘运输伊朗原油、石油产品及石化产品的船只。另据报道,也门胡塞武装当地时间8日称,向沙特利雅得哈立...
12:17
北京时间10月8日,多位美联储官员就货币政策密集表态。圣路易斯联储主席穆萨莱姆表示,需要进一步收紧货币政策以使通胀回到目标,未来6至9个月利率应当上调;美联储理事沃勒表示,如果经济数据符合预期,美联储可能仍需进一步加息以推动通胀更快回落至2%,但加息时点具有一定灵活性,无需在连续政策会议上采取行动,并称明年点阵图或反映"先加后降"。此前公布的美联储9月货币政...
12:17
国家税务总局增值税发票数据显示,国庆假期全国服务消费旺盛,相关行业日均销售收入同比增长19.5%,其中旅游游览和娱乐服务增长23.6%、餐饮服务增长9%、家用电器和音像器材增长40.1%、通信器材增长119.8%。出行方面,交通运输部数据显示,国庆假期(10月1日至7日)全社会跨区域人员流动量21.42亿人次,日均同比增长0.6%;高速公路新能源汽车日均充电...
12:17
「不准虐待Claude,否则取消你的使用资格」!就在刚刚,硅谷AI顶流Anthropic扔出了一项重磅新规——严禁所有人对Claude持续、无谓地辱骂和虐待。新出台的2026年最新《使用政策》(Usage Policy)中,新规将于11月12日全面生效。更绝的是,恶意违规者,官方毫不手软:警告、限流、封号三连击。而且,这个权限直接交给了AI...
12:17
GPT-6.1 Sol极速版,终于来了!今天,OpenAI正式上线Ultrafast极速模,API、Codex、ChatGPT Work三处同步推送。最强GPT-6.1吐字狂飙8倍,但价钱也跟着翻了6倍,每百万token输入12美元、输出60美元。不过先别急着肉疼,转头一看旗舰GPT-6 Astra极速版,价格直接是它的5倍。旗舰级的脑子加...
11:45
10月8日,中国人民银行发布《中国人民银行关于人民币汇率的政策立场》文章,首次全面、系统阐述人民币汇率的政策立场。文章强调,中国实施以市场供求为基础、参考一篮子货币进行调节、有管理的浮动汇率制度,坚持让市场在汇率形成中发挥决定性作用;中国贸易发展根源于产业国际竞争力的提升,中国没有必要也无意通过汇率贬值获取贸易竞争优势,从不搞竞争性货币贬值;央行不预设汇率目...
11:45
今日,港股科技板块集体反弹,截至10:36,恒生科技指数上涨1.5%。同花顺iFinD数据显示,截至昨日,恒生科技ETF易方达(513010)已连续3日获资金净流入,合计约3.7亿元。消息面上,日前,恒生指数公司公布恒生科技指数编算方法修订方案,成份股将由30只扩充至50只,于今年12月起生效。本次修订取消行业要求、将科技子主题由16个扩展至24个,并引入“...
11:45
截至10:00,创业板算力基础设施指数下跌2.5%。同花顺iFinD数据显示,截至昨日,创业板算力ETF易方达(158050)已连续6个交易日实现资金净流入,合计约6.5亿元。近日,算力光互连领域利好频出。格芯与台积电签署20亿美元硅中介层协议,AI芯片先进封装产能持续扩张;六大主要厂商加速布局VCSEL NPO,集邦咨询看好其成为现阶段Scale-Up光互...
11:45
国泰海通证券近日发布基金公司业绩排行榜。截至2026年9月30日,在大型公司中,仅有易方达基金一家主动权益和固收产品平均收益率同时跻身前五,且近十年平均收益率均位居第一。其中,主动权益类基金近十年平均收益率达211.95%,固定收益类基金近十年平均收益率达66.10%。股债市场周期并不同步,投研框架方法亦有差异,能够在主动权益和固收两个板块同时保持长期领先有...
11:45
截至2026年10月8日收盘,自由现金流ETF(159232)交投活跃,换手率达7.71%,成交额为1.84亿元。其跟踪标的——中证全指自由现金流指数录得0.64%的涨幅,成功实现“三连涨”。尽管10月8日作为节后首个交易日,A股市场整体普跌,沪深300指数下跌1.09%,但该指数逆势上扬,充分体现了“质量风格”在震荡市中的高胜率优势。 这一走势的驱动因素主...