研究人员推出了 AGENTCHAOSBENCH,这是一个旨在检测和精确定位基于 LLM 的代理系统中运行时故障的新基准。该基准数据集包含 275 个经过清理的执行跟踪,其中 250 个故障执行展示了十种不同类型的操作故障,另外还有 25 个无故障的对照跟踪。使用包括先进的 DeepSeek-v4-pro 模型在内的零样本 LLM 基线进行的初步实验表明,在准确识别故障类型及其位置方面存在重大挑战,最高准确率仅为 24.8%,故障类型和位置的组合识别率最高为 22%。研究还强调,即使有对齐的参考跟踪,依赖于参考的故障(例如绕过的护栏)仍然很难用现有方法解决。 AI
影响 强调了提高 LLM 代理系统可靠性和容错性的必要性,可能指导未来在代理系统设计和调试方面的研究。
排序理由 学术论文,介绍了一个用于 LLM 代理故障检测的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →