两篇新研究论文提出了改进大型语言模型(LLM)校准的方法。第一篇论文介绍了一个基于项目反应理论(IRT)的框架,该框架使用锚点项目来校准新基准,即使模型在不同数据集上随时间进行评估,也能实现可比的分数。第二篇论文提出了一种双层优化方法,在训练过程中修改模型参数以最大化预测分布的熵,直接针对过度自信问题并提高域外泛化能力。 AI
影响 这些方法可能带来更可靠和可比的LLM评估,提高基准结果的可信度,并有助于开发更鲁棒的模型。
排序理由 两篇在arXiv上发表的学术论文,提出了LLM校准的新颖方法。
- Bilevel Optimization for Cost Function Determination in Dynamic Simulation of Human Gait
- information entropy
- Large Language Models
- preference alignment
- question answering
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Eliya Habba
- generative question answering
- Gotit.pub
- Hugging Face
- Item Response Theory
- Multiple Choice Question Answering in the Legal Domain Using Reinforced Co-occurrence
- out-of-domain generalization
- Predictive distributions were developed for the extent of heterogeneity in meta-analyses of continuous outcome data.
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →