Anthropic 推出了其 Claude Code 工具的新评估工作流,旨在帮助开发人员测试和衡量插件的有效性。该系统名为 `claude plugin eval`,将插件与实际提示进行运行并对输出进行评分,将其与未使用插件的基线进行比较。它专门解决了插件技能是否被触发、在编辑或模型更新后是否保持功能以及是否优于裸模型的问题。该工作流包括六种评分器类型,其中四种是免费的,两种需要调用 judge model,并提供了一个清晰的指标 (Δ) 来量化插件的贡献。 AI
影响 增强了 LLM 插件集成的开发人员工具,可能加快开发周期。
排序理由 这是现有产品的新功能/工作流,而不是核心模型发布或研究论文。
- Anthropic
- Claude
- Claude Code
- Claude Code v2.1.269
- claude-haiku-4-5
- claude plugin eval
- .claude-plugin/plugin.json
- Claude Sonnet-5
- plugin.json
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →