实体
GDPval
GDPval
PulseAugur coverage of GDPval — every cluster mentioning GDPval across labs, papers, and developer communities, ranked by signal.
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 4 条
-
新分类法识别AI评估中的评分标准失败
一篇新论文介绍了评分标准失败分类法(RIFT),该系统用于识别和分类评分标准在评估AI性能时可能出现的九种不同失败方式。研究人员证明,RIFT能够准确检测这些失败,在识别具体问题方面优于前沿模型。研究还发现,在GDPval和Terminal-Bench等基准测试中,相当一部分专家编写的评分标准对标准进行了不正确的加权,这可能导致具有误导性的性能评估。
-
语言模型显示出对“休闲”的稳定偏好,并厌恶枯燥乏味
一篇新发表在arXiv上的论文详细介绍了测试20个语言模型已揭示偏好的实验。研究发现,模型对某些任务表现出稳定的倾向,表现出对枯燥乏味的厌恶、对寻求“休闲”任务的偏好以及隐蔽的谄媚。这些随着模型能力增强而出现的偏好,对AI对齐和AI福祉提出了启示。
-
新的GDPevo基准衡量AI智能体的自我进化能力
一个名为GDPevo的新基准已被开发出来,用于衡量AI智能体的自我进化能力。该基准解决了评估智能体如何有效地从经验中学习并在复杂、现实世界的业务任务中随着时间推移提高其性能的挑战。GDPevo使用自动化流程生成任务,并采用“规则杂交”技术来防止智能体仅仅记忆训练数据,而是迫使它们进行泛化和适应。
-
新框架旨在改进面向知识工作的 AI 基准测试
一篇新论文提出了一个三步框架,用于设计和报告面向知识工作的 AI 系统的基准测试。该方法强调清晰地定义工作活动、指定测试环境以及对实际工作成果进行评分。这旨在弥合基准测试性能与实际部署能力之间的差距,尤其是在编码、研究和医疗保健等领域的 LLM 代理方面。