资讯
Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills
📋总体概括
Anthropic为Claude Code发布了插件评测工作流,通过claude plugin eval命令让插件在真实提示下运行、自动评分,并与未加载插件的基线运行结果对比。该机制回答了此前插件开发者无法量化的三个核心问题,包括技能是否被正确触发等,并提供6种评分器类型与CI门禁能力,使插件质量验证可进入自动化流程。
⚡关键信息
- ▸Anthropic为Claude Code推出插件评测工作流,命令为claude plugin eval
- ▸评测流程:用真实提示运行插件,对Claude产出自动打分
- ▸核心设计是对照未加载插件的基线运行,量化插件的实际增益
- ▸评测回答三个此前无法测量的问题,包括技能是否被触发
- ▸支持6种评分器类型,并可将评测作为CI门禁用于技能发布流程
🔥犀利点评
插件生态的最大痛点从来不是能不能写,而是写完不知道有没有用、有没有被触发、有没有帮倒忙。Anthropic把「无插件基线对照」做成默认流程,等于逼着开发者用数据证明插件价值,这是把AI技能开发从手工作坊推向软件工程化的关键一步。CI门禁则说明Anthropic在为插件商店式的生态规模化铺路——没有自动评测门槛的插件市场,最后一定是垃圾泛滥。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →