Bradley-Terry-Luce model
PulseAugur coverage of Bradley-Terry-Luce model — every cluster mentioning Bradley-Terry-Luce model across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法利用偏好数据改进语言模型对齐
研究人员开发了一种新方法来改进语言模型与人类价值观的对齐,尤其是在使用偏好数据时。该方法解决了现有线性奖励模型的一些局限性,这些模型可能无法满足诸如帕累托最优和多数选择等关键公理。通过引入一个允许与严格线性产生微小偏差的“松弛”机制,新方法计算出一个满足这些公理且具有确定边际的宽松线性奖励。无论投票者是谁或比较是如何收集的,该技术都有效,并且它限制了所需的总松弛量。
-
新研究将LLM评估框架化为张量补全,以实现更好的不确定性量化
一篇新的研究论文提出了一个评估大型语言模型(LLM)的新颖框架,将成对的人类判断视为一个张量补全问题。这种方法解决了LLM评估平台中常见的嘈杂、稀疏和不均匀数据所带来的挑战。所提出的方法为量化LLM评估中的不确定性提供了一个原则性的途径,并且可以应用于各种成对比较数据集。
-
新算法从比较中学习工人可靠性和项目奖励
研究人员开发了一种新算法,可以从成对比较中同时学习项目奖励和工人可靠性,尤其是在众包环境中。所提出的方法利用了玻尔兹曼理性模型,通过纳入工人能力来扩展 Bradley-Terry-Luce 模型。使用 Polya-Gamma 潜在变量推导了一个基于 EM 的算法,将问题转化为具有理论收敛保证的矩阵传感任务。在合成数据和真实世界数据上的实验表明,该算法对不可靠和对抗性工人具有鲁棒性,并且优于现有基线。
-
研究发现全球LLM排行榜具有误导性,提出投资组合排名
一篇新的研究论文认为,目前大型语言模型(LLM)的排行榜因用户在不同语言和任务上的偏好存在显著异质性而具有误导性。该研究分析了Arena上52个LLM的约89,000次比较,发现全球排名常常掩盖了用户意见的特定亚群。为解决此问题,研究人员提出了一种$(\lambda, \nu)$-投资组合框架,这是一小组模型,旨在以有界的预测误差覆盖特定比例的用户偏好。