Plackett-Luce model
PulseAugur coverage of Plackett-Luce model — every cluster mentioning Plackett-Luce model across labs, papers, and developer communities, ranked by signal.
-
新的分层模型增强了分组数据的排名聚合 · 跟踪到2个来源
研究人员引入了分层偏序(HPO)模型,这是现有排名聚合技术的扩展,旨在处理具有潜在分层结构的分组数据。这些模型建立在偏序概念的基础上,允许偏好中的不可比性,并能够跨组进行原则性的信息共享。该论文还提出了用于无监督聚类的分层聚类偏序(HCPO)模型,并展示了它们在包括LLM代理轨迹在内的各种数据集上的有效性,在预测性能和可解释性方面优于现有方法。
-
新的软秩扩散模型增强排列学习
研究人员开发了一种名为软秩扩散 (Soft-Rank Diffusion) 的新扩散模型,用于学习排列上的概率分布。该方法通过使用软秩前向过程,将离散秩松弛为连续表示以获得更平滑的轨迹,从而改进了现有技术。该模型还结合了上下文广义 Plackett-Luce 去噪器以增强表达能力。实验表明,Soft-Rank Diffusion 在序列任务和长序列上优于之前的扩散基线。
-
新的Mult-DPO方法使LLM与推荐系统对齐
研究人员开发了Mult-DPO,一种用于将大型语言模型与推荐系统对齐的新方法。传统的DPO方法依赖于成对偏好,这不适用于推荐中常见的集合式反馈。Mult-DPO引入了一个可处理的多项式替代似然函数来处理这些集合式偏好,从而能够直接将LLM对齐到推荐任务。该方法还通过使用更丰富的负面示例来改进对齐效果。
-
新算法使用对话式查询进行个性化多目标老虎机
研究人员开发了一种新算法 MO-PQUCB,旨在改进多目标老虎机问题中的个性化决策。该算法独特地利用用户的主动对话式查询,例如“便宜又干净”选项的请求,以更好地理解他们的偏好。通过将这些结构化的偏好信号与传统的老虎机反馈相结合,MO-PQUCB 旨在加速偏好估计并减少与现有方法相比的遗憾,即使查询不完美。
-
新的信用分配策略梯度方法改进检索系统训练
研究人员开发了一种名为“信用分配”策略梯度(CA-PG)的新型强化学习方法,以应对大规模检索系统中早期排序器(ESRs)训练的挑战。传统的策略梯度方法在实际应用中难以处理与候选集大小相关的高方差问题。CA-PG旨在通过基于目标项在任何候选集中被选中的概率来计算梯度,而不是整个集合的联合概率,从而降低这种方差。实验表明,这种方法可以提高收敛速度和训练稳定性,尤其是在大型候选集的情况下,这一点已通过合成和真实世界数据进行了验证。
-
新方法MASS-DPO通过高效的样本选择改进语言模型训练
研究人员开发了MASS-DPO,一种用于直接偏好优化(DPO)的新方法,可高效选择信息丰富的负样本来训练语言模型。该方法使用特定于PL的Fisher信息目标来识别互补信息的负响应的紧凑子集,从而减少了相似候选者的冗余。在推荐和多项选择QA基准上的实验表明,MASS-DPO在负样本数量显著减少的情况下,实现了相当或更优的准确性,改善了优化动态和对齐。