Bradley--Terry model
PulseAugur coverage of Bradley--Terry model — every cluster mentioning Bradley--Terry model across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新AI框架教自动驾驶汽车进行伦理决策
研究人员开发了一个“伦理决策头”(EDH)框架,利用深度强化学习赋予自动驾驶汽车伦理推理能力。EDH框架将伦理原则编码为可微分的奖励信号,使代理能够学习符合道德的驾驶行为。在CARLA模拟环境中评估了两种规范框架:功利主义和康德主义,训练利用了近端策略优化和基于人类偏好的Bradley-Terry奖励模型。值得注意的是,人类评分者偏好自我牺牲而非最小化伤亡,模型学习到了这种偏好,表明理论伦理处方与实际人类奖励之间存在差异。
-
新框架简化了非专业人士的AI奖励函数设计
研究人员开发了一个正式框架,以帮助非专业人士为AI任务创建与人类对齐的奖励函数。该过程包括将目标提炼为可衡量的结果,选择相关的结果变量,并通过偏好诱导拟合权重。该方法旨在维持一个无冲突的可行权重区域,该区域由偏好查询缩小,并被认为是第一个确定性地实现这一目标的此类方法。
-
大型语言模型显示出评论赞誉偏见,偏爱冷门电影而非热门电影
一项发表在arXiv上的新研究通过检查电影偏好来调查大型语言模型(LLMs)的评估倾向。研究人员发现,来自Anthropic、OpenAI、阿里巴巴集团和Mistral AI的八个模型一致偏爱评论上受赞誉但商业上冷门的电影,而非商业上成功但评论上未被认可的电影。这种评论赞誉导向随着每个家族模型规模的增大而增加。研究还表明,提示框架显著影响模型排名,这表明评论赞誉偏见可能在现实世界的LLM应用中间接体现出来。
-
新度量基于人类偏好对图像融合进行排名
研究人员开发了一种名为学习感知图像融合度量(LPIFM)的新度量,用于客观地对红外-可见光图像融合算法进行排名。传统的度量往往无法与人类对融合图像质量的偏好保持一致。LPIFM通过充当直接人类成对比较的替代品来解决这一问题,因为大规模进行此类比较成本过高。该模型在一个新的人类偏好数据集上进行训练,能够预测人类会偏爱两个融合图像中的哪一个,从而为评估融合算法性能提供了一种更可靠、可扩展的方法。
-
新型等渗 Bradley-Terry 模型增强配对比较分析
研究人员开发了一种新的等渗 Bradley-Terry 模型,以改进配对比较数据的分析,例如预测比赛结果和对参与者进行排名。这种新颖的模型通过交替梯度和等渗回归方法学习速率参数和反向链接函数,解决了现有 Bradley-Terry 和 Thurstone-Mosteller 模型中潜在的错误指定问题。所提出的方法确保训练误差单调改进,并通过允许精确平局来处理数据不足的情况。在足球、棒球和网球联赛的合成数据和真实数据集上进行的数值实验表…
-
研究:大型语言模型编码质量与人类一致性指标不同
一项新研究挑战了基于大型语言模型(LLMs)与人类编码员一致性来评估的普遍做法,认为人类共识并非总是真理。研究人员发现,虽然大型语言模型与人类在编码教育者信息上的一致性低于人类之间的平均一致性,但独立专家在不了解来源的情况下,对人类和大型语言模型的编码的偏好率几乎相等。该研究表明,人类共识有时会编码大型语言模型不复制的共同偏见,并提出了一个新的验证协议,以更准确地评估大型语言模型。
-
新分析解释Bradley-Terry模型迭代的加速收敛
研究人员分析了一族Zermelo型迭代方法在Bradley-Terry模型上的应用,旨在提高收敛速度。该研究为解释为何特定参数选择alpha=0通常比经典的Zermelo算法(alpha=1)收敛更快提供了理论见解。分析表明,异步更新与alpha=0结合是加速的关键,并在特定条件下证明了其在二分比较图上的最优性。
-
新的强化学习算法可从具有未知链接函数的偏好中学习
研究人员开发了一种新的强化学习算法,称为Sign-SZPO,即使在偏好与结果之间的关系未知的情况下,它也可以从偏好反馈中学习。这种方法避免了现有方法中常见的已知链接函数的限制性假设。Sign-SZPO估计值函数差的符号来构建策略更新方向,在经验评估中证明了可证明的收敛性和对错误规范的鲁棒性。
-
新的RENEW框架使用人类偏好来修复AI世界模型
研究人员推出了一种新颖的RENEW框架,旨在通过使用人类偏好来纠正可利用的动力学,从而改进离线强化学习中的世界模型。这种被称为人类反馈动力学学习(DLHF)的方法侧重于训练模型识别和避免其预测中的“幻觉”。RENEW通过将微调工作导向模型表现出最大不确定性和可利用弱点的区域来提高样本效率,这在Jumanji和经典控制环境的实验中得到了证明。
-
研究发现:少量数据更改即可颠覆顶级大语言模型排名
一篇新研究论文提出了一种评估大语言模型(LLM)排名系统鲁棒性的方法。研究发现,删除极小比例的偏好数据,低至0.003%,就可能显著改变Chatbot Arena等平台上表现最佳模型的排名。研究还指出,源自MT-bench偏好的排名比Chatbot Arena的排名更稳定,这可能归因于MT-bench使用了专家标注员。论文总结认为,众包人类评估和LLM作为裁判的偏好数据,在数据删除方面表现出相似的敏感性。
-
新的成对比较统计模型在不依赖随机可比性假设下发布
研究人员开发了一种新的成对比较统计模型,该模型不依赖于随机可比性假设。这个新模型扩展了现有的 Bradley-Terry 和 Thurstone 模型等框架,使用低维斜对称矩阵来确定成对概率。所提出的方法在随机可比性不成立的情况下(例如涉及多种技能的游戏)提供了改进的预测性能,并在稀疏数据条件下证明了理论上的最优性。
-
新攻击揭示常见 AI 排名系统的漏洞
研究人员发现基于最大似然估计 (MLE) 的排名系统(如 Bradley-Terry 模型)存在重大漏洞,这类系统常用于汇总成对比较的偏好。一项新研究提出了一种自适应子集选择攻击 (ASSA),可以有效地找到高影响力的扰动数据。在合成和真实世界选举数据上的实验表明,即使是少数战略性选民也能在最小扰动预算之外大幅改变排名,其效果优于随机和贪婪方法。
-
TuneJury:开放奖励模型增强文本到音乐的对齐
研究人员推出了TuneJury,这是一个开放的、实例级别的成对奖励模型,旨在改进文本到音乐生成中的偏好对齐。该模型利用公开可用的人类偏好标签进行训练,根据文本提示和音频片段预测音乐偏好得分。TuneJury展示了泛化到新的和分布外基准的能力,并且可以通过事后校准方法适应新的音乐生成器。
-
Reasoning Arena 通过追踪锦标赛提升 LLM 推理能力
研究人员开发了“Reasoning Arena”,一个旨在增强大型语言模型推理能力的新框架。该系统解决了可验证奖励强化学习中的一个限制,即不同推理轨迹的相同奖励导致梯度信号缺失。Reasoning Arena 通过使用追踪锦标赛进行一对一比较,将这些信息量不足的奖励组转化为有价值的训练数据,从而产生更丰富的相对奖励信号。该方法提高了训练效率和基准测试性能,平均比标准 RLVR 性能高出 7.6%。
-
新的Bradley-Terry模型为推荐系统提供更公平的排名
研究人员开发了一种新的数据驱动方法,使用Bradley-Terry模型来更公平地对推荐系统进行排名。该方法考虑了算法性能在不同数据集特征(如稀疏性和规模)上的变化。新方法还包括一个排名一致性指标,以及一种无需运行模型即可预测算法在未见过的数据集上的性能的方法。
-
LLM框架HPRO提升销售线索评分性能
研究人员开发了一种名为HPRO的新型基于LLM的销售线索评分框架,解决了传统方法在高风险领域中的局限性。该方法将结构化CRM数据与非结构化客户互动相结合,使用分层偏好排序目标。实验显示了最先进的性能,并在A/B测试中带来了销售量的显著提升。
-
新方法评估LLM在比较评估中的裁判可靠性
研究人员开发了BT-sigma,一种用于评估大型语言模型(LLM)作为比较评估中裁判的可靠性的新方法。该方法通过为每个LLM裁判引入一个判别器参数来扩展Bradley-Terry模型,从而可以直接从成对比较中联合推断项目排名和裁判可靠性,即使没有人类监督。在基准数据集上的实验表明,BT-sigma的性能显著优于传统的平均方法,并且其学习到的判别器与LLM判断一致性的独立测量值具有良好的相关性,有效地充当了无监督校准机制。
-
大型语言模型探索偏好对齐和失败缓解技术
研究人员正在探索新的方法,以使大型语言模型(LLM)与人类偏好保持一致并缓解特定的失败模式。一种方法使用直接偏好优化(DPO)来利用模型自身的失败作为训练信号,从而减少OCR模型中的文本退化。其他研究侧重于理解和控制LLM的时间偏好推理,为个人代理开发轻量级的本地偏好工具包,以及创建以人为中心的偏好驱动判断框架。诸如“思想包含”(Inclusion-of-Thoughts)和“批判驱动推理对齐”(Critique-Driven Rea…
-
新研究聚焦扩散模型、朴素贝叶斯和空间模式中的人工智能公平性
研究人员正在开发新方法,以确保各种应用中机器学习模型的公平性。一篇论文介绍了“StayFair”,通过将偏差分解为模型和引导分量,来在不同引导尺度下保持扩散模型的公平性。另一项研究提出了一种“偏差缓解朴素贝叶斯”分类器,该分类器融合了特定群体和汇总的似然估计,以平衡公平性和准确性。此外,一种新方法基于个体移动模式评估空间公平性,将该概念推广到静态位置之外。其他研究探讨了不同公平性指标之间的不一致性,强调了多指标分析的必要性,并利用最优…
-
AutoRubric-T2I 用极少量数据学习可解释的 VLM 评分标准
研究人员开发了 AutoRubric-T2I,这是一个用于文本到图像生成的创新框架,可以自动创建和优化显式的评分标准。这些评分标准指导视觉语言模型 (VLM) 评估图像质量和提示对齐度,显著减少了对大量人类偏好数据的需求。该系统将推理过程合成为候选规则,并使用逻辑回归精炼器来选择最具区分度的规则,从而以最少的标注实现了高质量、可解释的奖励信号。