PulseAugur
实时 11:02:01
English(EN) When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

新的基准 AGENTCHAOSBENCH 突出了 LLM 代理故障检测的挑战

研究人员推出了 AGENTCHAOSBENCH,这是一个旨在检测和精确定位基于 LLM 的代理系统中运行时故障的新基准。该基准数据集包含 275 个经过清理的执行跟踪,其中 250 个故障执行展示了十种不同类型的操作故障,另外还有 25 个无故障的对照跟踪。使用包括先进的 DeepSeek-v4-pro 模型在内的零样本 LLM 基线进行的初步实验表明,在准确识别故障类型及其位置方面存在重大挑战,最高准确率仅为 24.8%,故障类型和位置的组合识别率最高为 22%。研究还强调,即使有对齐的参考跟踪,依赖于参考的故障(例如绕过的护栏)仍然很难用现有方法解决。 AI

影响 强调了提高 LLM 代理系统可靠性和容错性的必要性,可能指导未来在代理系统设计和调试方面的研究。

排序理由 学术论文,介绍了一个用于 LLM 代理故障检测的新基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准 AGENTCHAOSBENCH 突出了 LLM 代理故障检测的挑战

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen ·

    当代理执行失败时:从遥测数据中检测和定位运行时故障

    arXiv:2608.14680v1 Announce Type: new Abstract: Reliability in LLM-based agentic systems is a property of the whole execution (its tool calls, model calls, guardrails, and inter-agent messages), not of the final answer alone, yet evaluating only task outcomes reveals little about…