HelpSteer2
PulseAugur coverage of HelpSteer2 — every cluster mentioning HelpSteer2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的UNM-DPO方法增强了语言模型的偏好学习
研究人员引入了一种名为不确定性归一化的直接偏好优化(UNM-DPO)的新方法,以改进语言模型从人类偏好中学习的方式。与标准的DPO不同,UNM-DPO通过纳入学习到的提示尺度来考虑人类反馈中偏好的强度和不确定性。新方法包括两个训练目标:仅优势(AO)和整体残差(WR),其中ULNM-DPO-WR通过响应长度进一步归一化奖励。在HelpSteer2和AlpacaEval等基准上的评估表明,与现有的DPO和SimPO基线相比,UNM-DP…
-
LLM作为裁判:口头置信度在新模型上优于对数概率
一篇新的arXiv论文提出了一种转变,关于如何将大型语言模型(LLM)用作裁判,建议对于2025年后的专有模型,口头置信度已成为比对数概率更稳健的评分机制。研究表明,这种“兼容性转变”在SummEval、AggreFact和HelpSteer2等各种基准测试中显而易见,涉及多达18个LLM。该论文引入了过度自信咨询和自我辩论来改善校准和分数分布,并指出与旧模型不同,新模型能以最小的成本适应这些补充。
-
新的校准反射方法增强了LLM的置信度估计
研究人员推出了一种“校准反射”(Calibrated Reflection)方法,以改进大型语言模型(LLM)对其输出置信度的估计。该方法结合了结构化推理和一种距离感知校准技术。关键创新包括用于评估所有可能标签的最大置信度选择(MCS)方法、一种基于反射的提示机制以提高推理的可靠性,以及一种考虑标签之间序数关系的校准技术。该方法在HelpSteer2和Llama T-REx等各种数据集上,对对话式和基于事实的分类任务都显示出了有效性。
-
新的LLM审计方法揭示数据缺陷和可控性问题
两篇新的研究论文探讨了审计和理解大型语言模型(LLM)行为的方法。第一篇论文介绍了一个数据审计流程,该流程使用影响力分数来识别HelpSteer2和Anthropic的HH-RLHF等对齐数据集中存在的错误和矛盾,揭示了当前基准测试完整性方面的缺陷。第二篇论文提出了一种审计LLM可控性的新方法,通过检查模型如何响应意识形态提示,发现模型可以通过系统提示进行高度调整,但表现出不同程度的可控性和饱和度。
-
为什么英伟达与 Bryan Catanzaro 一起构建开放模型
英伟达正在显著扩展其开放模型计划,发布更高质量的模型和数据集。该战略通过从开放语言模型中获取价值,为英伟达创造可持续的优势。公司的努力包括 Nemotron 系列,近期发布了 Nemotron 3 Nano 以及即将推出的 Super 和 Ultra 版本,同时还提供了一套全面的训练软件和数据集。