PulseAugur
实时 10:09:02
实体 PredAct-Bench

PredAct-Bench

PulseAugur coverage of PredAct-Bench — every cluster mentioning PredAct-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_180535 ·

    新基准评估带噪声工具的AI对话代理

    研究人员推出了PredAct-Bench,这是一个新的基准,旨在评估在所使用的工具容易出错的情况下,协助人类决策的对话代理。该基准侧重于教育场景,使用OULAD和PREDACT-CS等数据集,评估AI代理在面对不完美的工具输出时,指导教师等用户的情况。当前最先进的模型在向用户提供足够的透明度方面存在困难,可能导致过度依赖不准确的建议或幻觉,凸显了改进AI决策支持系统的必要性。