PulseAugur
实时 07:04:50
English(EN) OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

新的OSReward基准揭示VLM裁判对AI代理过于宽容

研究人员推出了OSReward,这是一个旨在评估视觉语言模型(VLM)作为计算机使用代理(CUA)裁判的可靠性的新基准。该基准包含一组多样化的CUA轨迹,其地面真实况判断来自多阶段的人工标注。研究结果表明,即使是最先进的VLM也表现出宽容偏差,将失败的CUA运行错误地归类为成功,并且最可靠的模型对于大规模使用来说成本过高。为解决此问题,该团队开发了OS-Shepherd,这是一系列开源奖励模型,在新的推理标注判断语料库上进行训练,提供了一种经济高效且稳定的替代方案。 AI

影响 为评估AI代理建立了新标准,有可能提高其训练和部署的可靠性和成本效益。

排序理由 该集群描述了一篇介绍用于评估AI代理的基准和模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的OSReward基准揭示VLM裁判对AI代理过于宽容

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, J… ·

    OSReward:为跨平台计算机使用奖励模型建立标准化评估

    arXiv:2607.28609v1 Announce Type: cross Abstract: Computer-using agents (CUAs) are advancing rapidly across the digital world. A CUA trajectory records the agent's actions, states, and reasoning. Verifying whether it fulfilled the task instruction is central to CUA evaluation, da…