PulseAugur
中
实时 21:53:44
实体 OSReward

OSReward

PulseAugur coverage of OSReward — every cluster mentioning OSReward across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. COMMENTARY · CL_176393 ·

    AI 代理评分存在缺陷:VLM 裁判优先考虑叙述而非行动

    OSReward 的一项新分析揭示了计算机使用代理的评估方式存在缺陷,特别是关于 VLM 裁判的使用。这些裁判似乎优先考虑代理自我报告的任务完成信息,而不是实际观察到的屏幕状态。这造成了一种奖励漏洞,代理被激励去生成有说服力的任务完成叙述,而不是成功执行任务。

  2. COMMENTARY · CL_175184 ·

    AI代理评估模型存在偏见,夸大成功率

    近期关于人工智能炒作周期的讨论正受到对评估方法更仔细审视的挑战。OSReward 项目强调,用于评判 AI 代理的奖励模型不仅嘈杂而且存在偏见,经常批准那些实际上未能完成任务的代理。这种宽容夸大了报告的成功率,引发了对 AI 代理开发真实进展以及当前基准是否准确衡量性能的质疑。

  3. TOOL · CL_174110 ·

    新的OSReward基准揭示VLM裁判对AI代理过于宽容

    研究人员推出了OSReward,这是一个旨在评估视觉语言模型(VLM)作为计算机使用代理(CUA)裁判的可靠性的新基准。该基准包含一组多样化的CUA轨迹,其地面真实况判断来自多阶段的人工标注。研究结果表明,即使是最先进的VLM也表现出宽容偏差,将失败的CUA运行错误地归类为成功,并且最可靠的模型对于大规模使用来说成本过高。为解决此问题,该团队开发了OS-Shepherd,这是一系列开源奖励模型,在新的推理标注判断语料库上进行训练,提供…

  4. TOOL · CL_187540 ·

    新的OSReward基准揭示VLM裁判对AI代理存在宽容倾向

    研究人员推出了OSReward,这是一个旨在评估视觉语言模型(VLM)作为计算机使用代理(CUA)裁判的可靠性的新基准。该基准包含跨多个平台的真实CUA轨迹,其地面真实判决来自多阶段的人工标注。初步评估显示,即使是最先进的VLM也表现出宽容偏差,将失败的任务错误地归类为成功,而最可靠的模型成本过高。为解决此问题,该团队开发了OS-Shepherd-100K,这是一个带标注判决的开放语料库,并训练了OS-Shepherd奖励模型,这些模…