实体
ReOPD
ReOPD
PulseAugur coverage of ReOPD — every cluster mentioning ReOPD across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的策略内蒸馏方法提升LLM推理能力和效率 · 跟踪10个来源
多篇研究论文探讨了语言模型策略内蒸馏(OPD)技术的进展,旨在提高推理能力和训练效率。包括SimpleOPD、S$^2$VOPD、LOPD、CROP、DAPD和REOPD在内的几种方法,引入了新颖的策略来解决分词器不匹配、特权幻觉和选择性监督等挑战。这些方法旨在提高数学推理、代码生成和细粒度感知等任务的性能,其中一些方法展示了相对于现有方法的显著提升,甚至超越了Gemini-2.5-Pro和GPT-5.4等大型模型。
-
新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源
研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…