实体
AIRS-Bench
AIRS-Bench
PulseAugur coverage of AIRS-Bench — every cluster mentioning AIRS-Bench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Meta FAIR 使用 LLM 裁判在执行前对 ML 实验进行排名
Meta 的 FAIR 部门开发了 AI 研究偏好模型 (RPM),它们充当冻结的 LLM 裁判。这些模型在执行前评估和排名潜在的机器学习实验候选者,旨在减少研究时间和计算成本。在 AIRS-Bench 上进行测试,该系统提高了平均分数,并显著加快了获得结果的时间。
-
AI研究偏好模型通过预测有前景的解决方案来加速机器学习研究
研究人员开发了AI研究偏好模型(RPMs),以帮助AI研究代理更有效地分配有限的GPU资源。这些模型无需完全执行即可预测哪些候选解决方案最有前景,从而加速了研究过程。当集成到AIRA-dojo搜索代理中时,RPMs在AIRS-Bench基准测试中提高了性能,缩短了达到特定性能水平所需的时间,并在两项任务上取得了新的最先进成果。