实体
Near-Policy Distillation
Near-Policy Distillation
PulseAugur coverage of Near-Policy Distillation — every cluster mentioning Near-Policy Distillation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新基准挑战AI预测人权损害赔偿金能力
研究人员推出了ECtHR-NPD,一个旨在预测欧洲人权法院案件中精神损害赔偿金的新基准。该基准包含14,575个以欧元计价的赔偿案例,旨在解决法律基准中未被充分探索的持续性金钱救济领域。使用包括微调语言模型和知识增强代理在内的各种方法的初步评估显示,复杂的AI方法并未持续优于简单的基于特征的基线。模型在识别零赔偿和准确预测高额赔偿案件方面尤其困难,这表明ECtHR-NPD对当前AI能力提出了重大挑战。
-
中国教练帮助女性逃离自恋关系 · 跟踪 1 个来源
中国教练正在为寻求摆脱与自恋伴侣关系的女性提供指导和支持。这些教练通常会分享自己的经历,讨论在中国的社交媒体平台上广受欢迎的自恋型人格障碍(NPD)等话题。尽管在线诊断的科学有效性存在争议,但许多受害者通过这些服务找到了认同和实用的建议,其中一些人为此类指导支付了高额费用。
-
新方法增强LLM的On-Policy蒸馏
研究人员开发了新方法来提高大型语言模型On-Policy蒸馏(OPD)的效率和稳定性。一种方法vOPD使用源自反向KL散度的控制变量基线,在没有显著计算开销的情况下降低梯度方差。另一种方法ROPD仅使用教师生成的响应即可实现基于规则的蒸馏,提供了基于logit的OPD的黑盒兼容替代方案。第三种技术Near-Policy Distillation(NPD)通过异步生成和选择性打包来加速该过程,实现了显著的加速并优于标准微调。