一个名为 muteval 的新工具旨在通过识别缺失的测试(而不是仅仅报告现有失败的测试)来解决 LLM 测试中的一个关键盲点。与传统的测试运行器不同,muteval 会通过移除规则或削弱参数来故意降级系统,然后重新运行现有的测试套件。如果输出发生变化但所有断言仍然通过,它就会将此标记为“幸存者”,表明测试覆盖范围存在需要关注的差距。这种方法有助于开发人员发现当前测试套件未涵盖的行为,从而提供对评估完整性的不同视角。 AI
影响 帮助开发人员识别和解决 LLM 评估套件中的差距,从而可能提高模型的可靠性。
排序理由 该项目描述了一个用于 LLM 评估的新软件工具。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →