加载中
周一至周六

每日 8:00-23:00

联系MK体育

[email protected]

客服与订单 010-8888-6666

AI写代码省的时间,全赔在调试上?Claude官方:让AI自己测、自己改 - MK体育

  • 首页
  • 博客详情
2026年9月18日 250 15 足球赛事

设想一下这个场景:

你借助Claude Code迅速搭建了一个小型应用,还为其集成了AI客服功能。原本期望它能自主应对诸如“如何登录”“会员服务包含哪些项目”这类基础询问,从而让自己得以解脱,做个轻松的管理者。

然而,客服确实具备了对话能力,但你却变成了它的专属训练师:回答不精准时,你得立刻补充提示词;解释过于冗长,你又要增加约束条件。

更令人沮丧的是,每次调整提示词后,你都必须重新测试所有常见问题,担心顾此失彼——修复了一个错误,却导致原本正确的回答出现问题。

结果,用AI编写程序所节省的时间,很大一部分又消耗在了反复的人工调整上。

针对这一循环调试的痛点,Anthropic于9月28日发布了一份优化指南。

这份指南的核心思想很简单:像反复测试、修改这类任务,Claude同样能够胜任。

让它承担更多工作,你就能减少充当疲惫测试员的次数,将更多精力用于监督AI:设定规则,明确何为合格,并检查其是否真正达标。

将模糊要求转化为具体测试

要让AI有目标地修正错误,首先得清晰定义“正确”的标准。

我们通常希望AI客服“更可靠”,但这种表述过于笼统。

如果能把要求落实到用户实际会遭遇的具体情境中,标准就会变得明确。

例如:

用户找不到导出按钮时,它能否提供准确的点击步骤? 当用户询问尚未开发的功能时,它是否会虚构答案? 面对退款问题,它能否按照既定规则处理,并在不确定时不随意承诺?

官方提供的第一个工具是:/claude-api build-eval。

简单来说,它能将这些具体需求转化为测试题目,为集成了Claude的小应用建立一套可重复执行的验收题库。

你可以把那些经常导致AI出错的场景交给它,但题库不能仅包含“失败案例”,那些最常见、最普通的问题也必须涵盖。

否则,即便收集了大量偏题、难题,也可能无法准确反映普通用户的真实体验。

题目确定后,还需要明确“评分标准”。

“专业”“智能”“友好”这类要求过于宽泛,需要细化到更具体的衡量指标。

比如,哪些信息必须包含,哪些错误绝对不能出现,达到什么程度才算合格。

官方邮箱分类示例:测试样例需由用户确认。

Claude会协助你制定相应的评分规则,而你需要确认,按照这套规则获得高分的答案,是否真正解决了用户的问题。

有些结果可以用程序自动检查,例如是否遗漏关键字段;对于存在多种合理答案的开放性提问,也可以让模型依据明确规则进行评分。

但评分器本身也需要验证。

选取几份已评分的答案,对照你自己的判断,检查是否存在“回答正确却被扣分”或“未解决问题却通过”的情况。

确认评分机制可靠后,再进行定期抽查。

对开发者而言,这一步骤最大的好处在于,你终于可以将“怎么又答错了”这种反复抱怨,转化为一套可持续运行的自动化检查流程。

以后每次修改提示词,都能重新运行一次,看看这次修复了哪里,是否又破坏了其他部分。

自我测试与自我修正

题库建立后,接下来就是使用第二个官方工具:/claude-api hillclimb。

hillclimb可以理解为“爬坡”,让AI逐步尝试优化,观察是否有进步。

但这个目标同样需要具体化,并且要明确允许它修改哪些内容。

例如,让客服回答更准确,允许它修改提示词;或者在保持回答质量的前提下,尝试降低API费用,允许它调整模型配置。

接到任务后,Claude会查看用于迭代的错误案例,每轮提出一处修改,然后重新运行评估:

如果修改后确实改善了既定目标,则保留修改;如果反而退步,则撤销。

根据官方文档,这两个工具都需要Claude Code v2.1.259及以上版本。

提示词、技能文件、工具说明和模型配置等都可以作为优化对象,但具体修改哪些内容,需要由你划定范围。

你可能会担心:AI是否会变成只会应试的“做题家”?即只针对你提供的几道题死记硬背,换一种问法就开始胡言乱语?

官方确实考虑到了这一点。

这套流程会专门留出一部分题目,作为不提前公开的“验收考题”。

负责提出修改的模型看不到这些题目的内容。每轮修改后,再用这些题目测试,看看效果是真正提升了,还是只对练习过的题目有效。

如果练习过的题目分数上涨,但“验收考题”的成绩没有提高,就可能出现了“过拟合”:越来越擅长做熟题,但面对新题目却没有进步。

遇到这种情况,Claude会撤销本轮修改;如果修改后表现反而变差,同样会回退。

每轮修改后复测,根据结果保留或撤回。

这有助于发现“只会做熟题”的问题,但并不意味着从此可以高枕无忧。

题库本身未能覆盖的真实问题,仍然可能导致它出错。

官方客服案例

Anthropic通过一个内部客服评测展示了效果。

在14张未参与指导修改的留出测试工单上,最终配置的决策准确率从78.6%提升至90.5%,提高了11.9个百分点,模型调用成本降低至原来的约五分之一。

调整模型、思考强度与提示词,改善准确率和成本。图中为迭代集成绩。

不过,这是一组特定配置、特定小样本下的结果,并不意味着接入这套流程后,你的应用也能节省八成成本。

这里比较的模型调用成本,也不能代表整个项目的总成本。

但对于自掏腰包支付API费用的个人开发者来说,这仍然很有吸引力。

毕竟,便宜的模型如果总是答非所问,导致用户反复追问,最后还需要你人工介入,可能并不划算。

而简单问题如果也使用昂贵的配置,并生成大量不必要的解释,同样可能浪费资金。

现在,你可以将回答质量和调用成本放在一起测试,让AI在满足质量要求的前提下,尝试更经济的方案。

不过,优化过程本身也会消耗模型调用费用。

先确定你愿意投入多少实验费用,再决定让AI运行多少轮,这样会更稳妥。

将时间投入到真正重要的事情上

当这套自动化流程运行起来后,你就有机会减少重复的提示词修补工作,将精力重新聚焦在产品本身。

首先,是理解用户。

你认为理所当然的操作,首次使用应用的人可能连入口都找不到。你需要做的,是将这些真实发生的困惑补充进题库,这样AI的下一次优化才能更贴近实际。

其次,是把控标准。

回答再礼貌,如果没有解决问题,能算合格吗?意思明明相同,只是换了一种说法,评分器是否会误判?

评分标准本身如果有漏洞,AI可能白忙一场,只是分数上涨了,但用户的问题依然存在。

邮件分类评测:左侧查看各题得分,右侧回看模型输入与回答,核查评分是否合理。

最后,是进行权衡。

回答简化会不会遗漏必要步骤?追求低成本是否会牺牲准确度?这些关乎用户体验的关键决策,仍然需要你来拍板。

为应用接入AI,初衷是为了省心。

如果最终演变成你全天候陪伴它修改答案,那就本末倒置了。

当Claude能够承担更多重复调试工作,普通开发者就能有更多时间打磨自己的小工具、小应用,让那些被搁置的想法重新得以推进。

参考资料:

https://claude.dev/blog/automating-eval-design-and-hillclimbing/?utm_source=chatgpt.com

本文来自微信公众号,作者:ASI启示录,编辑:元宇,36氪经授权发布。

MK体育

MK体育深耕赛程查询领域,用心服务每一位用户。

+86 138-

[email protected]

北京市朝阳区建国路934号