实体
Holistic Agent Leaderboard
Holistic Agent Leaderboard
PulseAugur coverage of Holistic Agent Leaderboard — every cluster mentioning Holistic Agent Leaderboard across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI脚手架显著影响模型性能,分析发现
来自研究人员Hans Gundlach、Zach Brown、Jayson Lynch和Neil Thompson的新分析表明,提供给AI模型的软件环境和上下文文档(称为“脚手架”)可以显著影响性能。他们的研究结果基于Holistic Agent Leaderboard (HAL)的数据,表明脚手架可以解释比模型本身更多的性能差异,某些脚手架会导致推理效率高达100倍的差异。该研究还强调,脚手架的有效性可能因特定模型和任务而异,这对A…
-
AI模型评估正成为昂贵的瓶颈,成本已超越训练费用
AI模型评估正变得成本高昂,近期基准测试的成本高达数万美元,并消耗数千个GPU小时。对于本质上更复杂且对设置变化敏感的基于代理的评估而言,这种高成本尤为突出。虽然存在通过子采样降低静态基准测试成本的方法,但这些技术对于基于代理的评估的动态和嘈杂特性效果不佳,从而造成了研发瓶颈。