实体
Reingold
Reingold
PulseAugur coverage of Reingold — every cluster mentioning Reingold across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
LLM评估偏差:赢家诅咒夸大了性能指标
在LLM评估中,一种常见的做法是针对固定数据集测试多个提示变体,并选择表现最佳的一个,这可能导致性能指标虚高。这是由于“赢家诅咒”,即嘈杂测量值的最大值本身就存在向上偏差。例如,在一个包含250个样本的数据集上测试四十个提示变体,即使没有取得实际进展,也可能产生约五分的表观改进。研究人员建议采用分离开发集和确认集、根据实验次数调整性能阈值、仔细记录数据集查询次数以及定期刷新评估集等做法来缓解这种偏差。
-
新研究简化了在线学习到多校准的归约
研究人员开发了一种从在线学习到在线多校准的新黑盒归约方法,该方法简化了高维多校准的实现。该方法将任何无遗憾学习器与期望变分不等式求解器相结合,为多校准提供了一种更通用的方法,并具有改进的保证。此外,该研究还建立了从高维在线多校准到上下文 $\Phi$-遗憾最小化的精细归约,为 $\Phi$-遗憾提供了一条新的途径,该途径绕过了复杂的机制并产生了更鲁棒的算法。
-
新的MBLG框架实现了多项式时间生成
研究人员开发了一个错误有界语言生成(MBLG)框架的多项式时间版本。这个新框架表明,奇偶校验和文字合取族可以在多项式时间内生成。一个关键发现是,具有多项式数量最大项的单调布尔函数是多项式时间MBLG,这一类别包含了所有可由多项式大小决策树计算的单调布尔函数。所采用的技术涉及一种新颖的组合游戏。