Claude Code 2.1.269:给插件跑评分的 plugin eval 来了
一个人做产品,用 Agent 干活最常见的状态是:改一遍 prompt,跑一遍,看着输出觉得不错,上线。第二天换一批输入,效果崩了,你还不知道是哪次改动导致的。
9 月 11 日的 Claude Code 2.1.269 补上了这个缺口里最实用的一块(官方 changelog 原文):
claude plugin eval:对一个插件运行它的评测套件,产出有分数、可复现的结果,同时生成 JSON 与 HTML 报告。/output-style [name]:列出并切换输出风格,且支持在 Remote Control、云会话与其他无头(headless)会话里使用。CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1–256):提高单次 Workflow 运行的并发子代理上限,面向”推理密集的扇出”。
第三条容易被忽略但很值钱。Workflow 默认并发是保守值,如果你让 Agent 并行处理 20 个文件、跑 20 组参数,之前是排队;调高之后是并行,墙钟时间能压到原来的零头。代价是真金白银的 token 和可能的限流,所以要和预算一起看。
真正值得今天就动手的是第一条。插件 / Skill 以前是”写完就那样”,现在有了一条可执行的检验路径:
- 写一个评测套件:挑 10–20 条你真实遇到的输入,每条写清楚期望输出长什么样(命中哪些关键词、必须包含什么结构、绝对不能出现什么)。样本不用多,但必须是真的、难的那批。
- 跑一次基线:
claude plugin eval,把 JSON 结果存进仓库。这一步的价值不是看分数,是拿到一个以后可以对比的数字。 - 改动之后重跑:每次调 prompt、改工具定义、换模型,都跑一遍并和基线 diff。分数掉了就知道是哪次改动碰坏的。
- 接进 CI:JSON 输出是可以机器读的,设一个阈值,低于不过关就阻断。这就是一条最简的质量门。
泼点冷水:eval 分数高不等于你的产品好用。评测集是你自己写的,它只会优化你在样本里定义的那件事——样本偏了,分数会把你引向错误的方向。所以评测集要定期从真实线上对话里补样本,而不是一直用最初那 10 条。另外这版本发布第二天就有 2.1.270 修了一个 2.1.269 引出的回归(Bash 里只读 git 命令开始反复问权限),升级时注意看一眼后续版本。
对一人公司的具体意义:Agent 产出物终于可以进版本管理了。以前”这个 prompt 改坏了”只能靠记忆和直觉,现在是一次 claude plugin eval 的差异对比。这一步跨过去,Agent 才从”助手”变成”可以被信任的流水线环节”。
原文出处 · 事实以此为准
Claude Code Changelog