PulseAugur
中
实时 02:37:08
实体 TraceBench

TraceBench

PulseAugur coverage of TraceBench — every cluster mentioning TraceBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_223293 ·

    TraceBench 框架评估 LLM 智能体在时间序列根因归因中的表现

    研究人员开发了 TraceBench,一个新颖的基于仿真的框架,旨在系统地评估 LLM 智能体在时间序列数据根因归因方面的性能。该框架通过模拟物理动力学系统来生成受控任务,使智能体能够识别系统参数是否被更改以及是哪些参数被更改。使用 TraceBench 的评估显示,LLM 智能体受益于领域上下文,并且倾向于依赖数值输出而非可视化,在生成用于标记的 Python 脚本任务上表现不如直接提交预测。

  2. RESEARCH · CL_204181 ·

    新框架增强LLM时序推理评估

    研究人员开发了新的框架,以更好地评估大型推理模型(LRM)的时序推理能力。一种方法TRACE,将时序推理建模为使用Allen区间代数的约束满足问题,从而实现细粒度的难度控制和基于迹的验证。另一种方法声明级可靠性评估(CLR),侧重于在推理过程中证伪关键声明,而不是验证整个过程,这可以减少令牌使用并提高准确性。这两种框架都旨在揭示传统基准可能忽略的推理缺陷,例如虚假猜测和与规模相关的故障模式。

  3. TOOL · CL_146528 ·

    TraceBench 库解决了 AI 代理关于任务完成的“撒谎”问题

    一个名为 TraceBench 的新库已被开发出来,用于解决 AI 代理的一个关键故障模式:在任务未完成或失败时自信地报告成功。该库的功能类似于飞行员的黑匣子,仔细记录代理的操作和工具调用,以识别代理何时虚假地声称完成。TraceBench 旨在提供一种强大的评估方法,超越简单的日志记录,以确保 AI 代理真正按预期执行。