研究人员开发了ContractEval,一个旨在评估LLM代理程序指令一致性的新诊断框架。该系统明确识别代理未能满足特定义务的情况,例如跳过检查或违反不变式,这可能导致看似正确但无根据的输出。ContractEval将这些程序指令表示为查询活跃义务,并将其与响应或跟踪证据进行匹配,区分各种类型的一致性失败。在对审计的程序合同进行的测试中,ContractEval成功检测并定位了所有被传统仅输出和跟踪感知裁判所遗漏的注入结构性失败。 AI
影响 增强了LLM代理程序的审计能力,提高了复杂任务执行的可靠性。
排序理由 该集群包含一篇详细介绍LLM代理评估新框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Connected Papers
- ContractEval
- CORE Recommender
- Hugging Face
- Litmaps
- LLM agents
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →