实体
Hardt
Hardt
PulseAugur coverage of Hardt — every cluster mentioning Hardt across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM评估偏差:赢家诅咒夸大了性能指标
在LLM评估中,一种常见的做法是针对固定数据集测试多个提示变体,并选择表现最佳的一个,这可能导致性能指标虚高。这是由于“赢家诅咒”,即嘈杂测量值的最大值本身就存在向上偏差。例如,在一个包含250个样本的数据集上测试四十个提示变体,即使没有取得实际进展,也可能产生约五分的表观改进。研究人员建议采用分离开发集和确认集、根据实验次数调整性能阈值、仔细记录数据集查询次数以及定期刷新评估集等做法来缓解这种偏差。
-
新论文表明更多AI模型创造定价套利机会
Olmedo、Schölkopf 和 Hardt 的一篇近期论文表明,越来越多的AI模型为定价中的计算套利创造了机会。研究表明,模型的扩散可能导致市场效率低下,从而被利用。