一篇新的研究论文介绍了一种名为“顺序一致监督微调”(Order-Consistency Supervised Fine-Tuning, OC-SFT)的方法,旨在减少大型语言模型(LLM)评分器中的顺序依赖性。这些评分器用于候选文档重排和多文档问答等任务,即使在展示出相等的排名质量时,也可能因为提示中候选项目的顺序而产生不同的决策。OC-SFT通过惩罚不同排序下的分数不一致来解决这个问题,从而在保持排名质量的同时提高决策的稳定性。该论文建议,未来对此类评分器的比较应侧重于决策的稳定性,而非仅仅关注排名指标。 AI
影响 提高了LLM在文档重排和问答等任务中基于决策的可靠性。
排序理由 介绍LLM评分器新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- LLM Scorers
- Multi-Document Question Answering
- NDCG@10
- OC-SFT
- Order-Averaged Distillation
- Order Dependence
- Passage Reranking
- Response Ranking with Multi-types of Deep Interactive Representations in Retrieval-based Dialogues
- Thomson Reuters
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →