实体
Mohammadreza Armandpour
Mohammadreza Armandpour
PulseAugur coverage of Mohammadreza Armandpour — every cluster mentioning Mohammadreza Armandpour across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新研究改进 AI 推理模型的 On-Policy Distillation
研究人员正在探索用于训练推理模型的 On-Policy Distillation (OPD) 技术,该技术使用教师模型提供每 token 的监督。然而,OPD 的有效性和最佳配置仍不清楚,其中“崩溃”(推理路径变窄)等问题是一个重大挑战。新的方法,如 RouteOPD 和 TV-Regulated OPD,分别旨在通过显式建模概率传输和稳定训练动态来改进 OPD。一篇关键性评论还综合了现有研究,确定了 token 加权、特权信息和引导…
-
新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源
研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…