SCPO
PulseAugur coverage of SCPO — every cluster mentioning SCPO across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的LLM方法利用隐藏状态几何来改进推理
研究人员开发了Cloud-ScPO,一种用于大型语言模型(LLM)半监督偏好优化的新颖框架,该框架利用了内部模型状态的几何结构。该方法使用少量标记数据集来构建正确和不正确推理轨迹的参考“Clouds”。通过分析这些隐藏状态的连通性和空间组织,Cloud-ScPO可以在不需要完全验证的答案或外部奖励模型的情况下获得偏好信号。在GSM8K和MATH-Numeric数据集上的实验表明,与现有的ScPO方法相比,性能有了显著提高,在GSM8K…
-
新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源
研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…
-
新的SCPO算法优化LLM文化偏好,减少偏见
研究人员开发了一种名为SCPO(可控的奖励模型文化偏好优化)的新算法,以改善大型语言模型(LLM)在不同文化群体中的对齐。该方法旨在通过将多样的文化偏好纳入奖励模型来防止LLM过度偏向特定地区。SCPO在PRISM和GlobalOpinionQA等数据集上,少数群体奖励模型的性能提高了7个百分点,并且比传统的微调方法具有更高的数据效率。