模型与评估 / 机制解读

让 Claude 建 eval 再调 prompt:真正要守住的是题目、评分器和留出集

Anthropic 的工程文章确认了两个技能命令:`/claude-api build-eval` 用于在代码库里构建评估,`/claude-api hillclimb` 用于围绕评估逐轮优化。[[7] Automating eval design and hillclimbing with Claude / clau...

主题机制示意图,非产品截图或实测数据
机制示意 · 非实测数据

让 Claude 建 eval 再调 prompt:真正要守住的是题目、评分器和留出集

Anthropic 的工程文章确认了两个技能命令:`/claude-api build-eval` 用于在代码库里构建评估,`/claude-api hillclimb` 用于围绕评估逐轮优化。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 这不是“模型自动出题,所以模型一定能自己证明正确”,而是把采样、判分、改动和复验组织成一条可检查的流程。

出题之前,先说清你要量什么

官方提出的评估条件包括:任务接近实际使用分布、更强模型和更多思考通常能改善表现、存在可通过但尚未饱和的难度空间,以及较低的重复运行方差。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 如果任务对所有模型都一样失败,可能是任务本身含糊或不可能完成,不应立刻解释成“这个问题很有区分度”。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/)

build-eval 优先考虑真实生产对话,并询问留存和敏感数据;其次是 bug 报告、客服工单、人工样例,之后才是从代码库合成的数据。生成的输入会通过页面展示,等待人确认。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 这个顺序重要:合成器擅长制造形式完整的题目,却未必知道业务最在意哪种错误。

我们的分析:给退款机器人出题,不能只问“语气是否友好”。更关键的是退款资格、金额上限、订单是否匹配,以及无证据时是否转人工。真实工单可以提供这些冲突,但也可能包含敏感信息;脱敏和使用许可属于评估准备,不是模型优化完成后再补的手续。

评分器也需要考试

对固定标签、schema 或程序测试,官方优先使用代码检查;开放答案则可以使用第二个模型,依据可核查的规则判分,而不是随意给一个观感分。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 产物包含案例、评分器、运行器、逐案例 JSON 记录与完整轨迹,结果页能追到每个案例的执行记录。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/)

我们的分析:仅让另一模型写“正确”不算独立验证。可以准备一组人工确认的好答案、明显错误答案和边界答案,先检查评分器能否区分。若评分器奖赏篇幅而不是证据,优化器就会学会写长;若它只看格式,模型就会学会交出格式完美的错误结果。

hillclimb:每次改一处,是为了归因

官方流程在开始前确认优化目标,并随机拆分 train 与 test。每轮读取训练轨迹,提出一个补丁;训练进步而测试不动时怀疑过拟合并回退,出现退步也回退,双方改善才保留。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 首轮还会检查随机波动是否小于值得采取行动的改进,不够则建议增加重复或案例。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/)

“只改一处”的价值不是神奇地消灭所有混杂因素,而是让结果更容易解释。我们的分析:如果同一轮同时更换模型、改工具、调整提示词和更新评分器,分数上涨以后很难知道谁起作用。即便搜索过程中使用留出分数作判断,反复依赖同一留出集也可能对它产生间接适应;重要发布最好再用未参与选择的新样本确认。官方的回退门槛降低风险,不是“彻底杜绝过拟合”的证明。

旧稿把两个案例拼成了一个

官方技能自身优化示例描述:通过率从 66.1% 上升到第 24 轮的 87.9%;图中阶段包括补充技能内容、修改代码生成指导,以及修正评分器后继续编辑。[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) 它不是“客服经过 14 轮从 66% 到 88%”。修正评分器也意味着必须核对前后比较口径,不能把全部上升简单当成应用能力的净提升。

另一个成本文章讨论客服基准:先尝试模型与 effort 组合,再读训练失败样本,增加路由规则和退款上限交叉检查;官方称最终留出结果相较原始设置改善,成本约为原来的五分之一。[[8] Reducing cost and improving performance with Claude Platform | Claude by Anthropic](https://claude.com/blog/reducing-cost-and-improving-performance-with-claude-platform) 这是特定案例的厂商结果,不是任何客服都能减少同等成本。旧稿把留出票据数量误写成迭代次数,再与技能通过率拼接,必须拆开。

这份成本材料还列出留出样本数量与带小数的百分比,但抓取文本没有解释评分是否按子项加权。我们不自行反推出“答对多少单”,正文也不把该百分比包装成简单整单准确率。

使用边界与落地方式|我们的分析

最适合先做的是可回放、可定义结果的流程:分类、工具参数选择、固定政策问答或补丁验收。开放研究也能评估,但要更认真地处理多种合理答案和引用事实。不能用易评分的替代指标冒充真实目标。

实际采用时先锁定输入与评分器版本,保存每轮补丁和完整失败轨迹,明确允许修改哪些文件;将最终代码评审与评估分数分别保留。若收益处于波动范围,不要为了漂亮曲线继续微调措辞。优化失败也有信息价值:它可能说明瓶颈在数据、工具环境或政策不明确,而不在 prompt。

本文未执行这两个技能或复现案例;所列命令来自官方,方法建议为我们的分析。真实的进步应该能解释“哪个错误减少了”,而不是只有一个越来越绿的总分。

Sources

[[7] Automating eval design and hillclimbing with Claude / claude.dev Blog](https://claude.dev/blog/automating-eval-design-and-hillclimbing/) https://claude.dev/blog/automating-eval-design-and-hillclimbing — Automating eval design and hillclimbing with Claude / claude.dev Blog
[[8] Reducing cost and improving performance with Claude Platform | Claude by Anthropic](https://claude.com/blog/reducing-cost-and-improving-performance-with-claude-platform) https://claude.com/blog/reducing-cost-and-improving-performance-with-claude-platform — Reducing cost and improving performance with Claude Platform | Claude by Anthropic

文章讨论

No comments yet