Bradley--Terry model
PulseAugur coverage of Bradley--Terry model — every cluster mentioning Bradley--Terry model across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的统计模型联合分析序数偏好和协变量
研究人员开发了一种新的统计模型,用于联合分析多元序数偏好和相关的协变量,解决了现有方法的局限性。该模型是一种协变量依赖的连续比马尔可夫随机场,与通常单独处理属性或将数据转换为成对比较的标准技术相比,提供了更细致的方法。所提出的方法还为具有难以处理的归一化器的情形提供了最大似然推断程序,并证明了标准比较模型是该联合模型的受限情况,从而提高了整体预测准确性。
-
新方法使用组合奖励改进文本到图像模型
研究人员开发了一种新的文本到图像模型训练后方法,该方法结合了人类偏好数据和基于评分标准的评估。这种方法旨在比单独的奖励信号捕捉更广泛的期望质量。该方法在 Arena 文本到图像排行榜上进行了测试,其中名为 Flux2dev 的模型取得了显著改进,Ideogram-4 超越了其他开源模型。
-
新的AMBER框架优化视觉-语言模型重排序
研究人员推出AMBER,一个用于优化视觉-语言模型(VLMs)在多模态检索任务中使用的创新框架。AMBER通过动态分配计算资源来解决VLMs的高推理成本问题,这与之前使用固定计划的方法不同。该系统使用连续的Elo更新来维护全局排序状态,并智能地选择候选视图和查询以最大化信息增益。在CIRR、CIRCO和PhotoBench等基准数据集上的实验表明,在相似预算下,AMBER的表现优于其他多调用VLM重排序方法。
-
新的UNM-DPO方法增强了语言模型的偏好学习
研究人员引入了一种名为不确定性归一化的直接偏好优化(UNM-DPO)的新方法,以改进语言模型从人类偏好中学习的方式。与标准的DPO不同,UNM-DPO通过纳入学习到的提示尺度来考虑人类反馈中偏好的强度和不确定性。新方法包括两个训练目标:仅优势(AO)和整体残差(WR),其中ULNM-DPO-WR通过响应长度进一步归一化奖励。在HelpSteer2和AlpacaEval等基准上的评估表明,与现有的DPO和SimPO基线相比,UNM-DP…
-
arXiv上的新研究推动了多臂老虎机算法和遗憾分析的进展 · 跟踪7个来源
arXiv上发表的多篇研究论文探讨了多臂老虎机(MAB)算法的进展。其中一篇论文重新审视了具有线性函数逼近的Softmax策略梯度在多臂老虎机场景下的全局收敛性,确定了渐近收敛的条件。另一篇论文解决了具有反事实公平性约束的因果逻辑老虎机问题,建立了minimax最优遗憾界。进一步的研究介绍了最大化广义平均福利的物品在线公平分配算法,并探讨了“上升多臂老虎机”中对时间跨度感知的益处。此外,还有研究深入探讨了基于偏好的老虎机问题的复杂性,…
-
研究发现:LLM 评委在偏好评估中表现出家族偏见
一篇新的 arXiv 论文研究了用于评判的大型语言模型 (LLM) 的选择如何影响成对比较中的偏好结果。研究发现,LLM 评委自身的模型家族显著影响其判断,引入了一种与被评估候选者质量混淆的偏见。研究人员开发了一种修正估计器来分离这种评委-家族效应,揭示了在 Llama 3.1、Qwen 2.5、Gemma 2 和 Yi 1.5 四个测试模型家族中普遍存在的“同家族提升”现象。研究还发现位置偏见是 LLM 作为评委设置中的另一种失效模…
-
新的老虎机算法实现了对数遗憾,且无逃逸维度依赖
研究人员开发了一种新的KL正则化上下文老虎机方法,专注于同时具有奖励和偏好反馈的场景。他们的工作表明,一种简单的贪婪采样方法可以在不依赖逃逸维度的前提下实现对数遗憾。该方法直接从估计奖励导出的Gibbs策略中采样,分析揭示了贪婪采样与置信上界风格探索之间的权衡,具体取决于KL正则化的强度。
-
新的 AI 对齐方法提高了效率和多维控制 · 跟踪 3 个来源
研究人员正在开发新的方法来使 AI 模型与人类偏好对齐,旨在提高效率和性能。一种方法 DSPA 使用推理时引导,根据提示进行对齐,在计算量更少的情况下有望改进 MT-Bench 和 AlpacaEval 等基准测试。另一种方法 DP3O 通过首先学习显式偏好模型,然后蒸馏其知识来解决离线和迭代对齐之间的差距,其性能优于最先进的离线方法并减少了训练时间。此外,MCDPO 通过对奖励本身进行条件化来解决标准 DPO 在扩散模型上的局限性,…
-
arXiv论文提出新的推断时AI对齐方法
研究人员引入了在推断时对齐AI模型的新颖方法,为RLHF和DPO等传统微调技术提供了一种更有效率的替代方案。这些新方法,Best-of-Nash (BoN) 和 Nash Mirror Descent (NMD),通过处理一般偏好而非依赖单一标量奖励模型,解决了现有推断时方法的局限性。所提出的算法被表述为在两人零和博弈中寻找纳什均衡,并在各种数据集上的实证表现与微调模型相当或超越。
-
直接偏好优化简化了大型语言模型的对齐
直接偏好优化(DPO)是一种用于对齐大型语言模型(LLMs)的新方法,与传统的基于人类反馈的强化学习(RLHF)相比,它简化了该过程。DPO将偏好学习重新构建为一项监督学习任务,无需单独的奖励模型和复杂的强化学习循环。这种方法计算效率更高,易于实现,使大型语言模型的对齐更加容易获得。
-
新的 MCMC 采样器使用偏好投票进行条件采样
研究人员开发了 Pref-MH,一种新颖的马尔可夫链蒙特卡洛 (MCMC) 采样器,它能够从由语义属性定义的分布中进行精确的条件采样,即使在无法进行精确密度评估的情况下也是如此。该方法利用成对比较,类似于 Bradley-Terry 模型,来推断偏好赔率并计算 Metropolis-Hastings 比率。Pref-MH 被证明在其类别中是最优的,并已成功应用于文本生成、分子设计以及使用大型语言模型和视觉-语言模型作为裁判的图像生成等任务。
-
新AI框架教自动驾驶汽车进行伦理决策
研究人员开发了一个“伦理决策头”(EDH)框架,利用深度强化学习赋予自动驾驶汽车伦理推理能力。EDH框架将伦理原则编码为可微分的奖励信号,使代理能够学习符合道德的驾驶行为。在CARLA模拟环境中评估了两种规范框架:功利主义和康德主义,训练利用了近端策略优化和基于人类偏好的Bradley-Terry奖励模型。值得注意的是,人类评分者偏好自我牺牲而非最小化伤亡,模型学习到了这种偏好,表明理论伦理处方与实际人类奖励之间存在差异。
-
新框架简化了非专业人士的AI奖励函数设计
研究人员开发了一个正式框架,以帮助非专业人士为AI任务创建与人类对齐的奖励函数。该过程包括将目标提炼为可衡量的结果,选择相关的结果变量,并通过偏好诱导拟合权重。该方法旨在维持一个无冲突的可行权重区域,该区域由偏好查询缩小,并被认为是第一个确定性地实现这一目标的此类方法。
-
大型语言模型显示出评论赞誉偏见,偏爱冷门电影而非热门电影
一项发表在arXiv上的新研究通过检查电影偏好来调查大型语言模型(LLMs)的评估倾向。研究人员发现,来自Anthropic、OpenAI、阿里巴巴集团和Mistral AI的八个模型一致偏爱评论上受赞誉但商业上冷门的电影,而非商业上成功但评论上未被认可的电影。这种评论赞誉导向随着每个家族模型规模的增大而增加。研究还表明,提示框架显著影响模型排名,这表明评论赞誉偏见可能在现实世界的LLM应用中间接体现出来。
-
新度量基于人类偏好对图像融合进行排名
研究人员开发了一种名为学习感知图像融合度量(LPIFM)的新度量,用于客观地对红外-可见光图像融合算法进行排名。传统的度量往往无法与人类对融合图像质量的偏好保持一致。LPIFM通过充当直接人类成对比较的替代品来解决这一问题,因为大规模进行此类比较成本过高。该模型在一个新的人类偏好数据集上进行训练,能够预测人类会偏爱两个融合图像中的哪一个,从而为评估融合算法性能提供了一种更可靠、可扩展的方法。
-
新型等渗 Bradley-Terry 模型增强配对比较分析
研究人员开发了一种新的等渗 Bradley-Terry 模型,以改进配对比较数据的分析,例如预测比赛结果和对参与者进行排名。这种新颖的模型通过交替梯度和等渗回归方法学习速率参数和反向链接函数,解决了现有 Bradley-Terry 和 Thurstone-Mosteller 模型中潜在的错误指定问题。所提出的方法确保训练误差单调改进,并通过允许精确平局来处理数据不足的情况。在足球、棒球和网球联赛的合成数据和真实数据集上进行的数值实验表…
-
研究:大型语言模型编码质量与人类一致性指标不同
一项新研究挑战了基于大型语言模型(LLMs)与人类编码员一致性来评估的普遍做法,认为人类共识并非总是真理。研究人员发现,虽然大型语言模型与人类在编码教育者信息上的一致性低于人类之间的平均一致性,但独立专家在不了解来源的情况下,对人类和大型语言模型的编码的偏好率几乎相等。该研究表明,人类共识有时会编码大型语言模型不复制的共同偏见,并提出了一个新的验证协议,以更准确地评估大型语言模型。
-
新分析解释Bradley-Terry模型迭代的加速收敛
研究人员分析了一族Zermelo型迭代方法在Bradley-Terry模型上的应用,旨在提高收敛速度。该研究为解释为何特定参数选择alpha=0通常比经典的Zermelo算法(alpha=1)收敛更快提供了理论见解。分析表明,异步更新与alpha=0结合是加速的关键,并在特定条件下证明了其在二分比较图上的最优性。
-
新的强化学习算法可从具有未知链接函数的偏好中学习
研究人员开发了一种新的强化学习算法,称为Sign-SZPO,即使在偏好与结果之间的关系未知的情况下,它也可以从偏好反馈中学习。这种方法避免了现有方法中常见的已知链接函数的限制性假设。Sign-SZPO估计值函数差的符号来构建策略更新方向,在经验评估中证明了可证明的收敛性和对错误规范的鲁棒性。
-
新的RENEW框架使用人类偏好来修复AI世界模型
研究人员推出了一种新颖的RENEW框架,旨在通过使用人类偏好来纠正可利用的动力学,从而改进离线强化学习中的世界模型。这种被称为人类反馈动力学学习(DLHF)的方法侧重于训练模型识别和避免其预测中的“幻觉”。RENEW通过将微调工作导向模型表现出最大不确定性和可利用弱点的区域来提高样本效率,这在Jumanji和经典控制环境的实验中得到了证明。