PulseAugur
实时 13:50:14
实体 Crosslingual On-Policy Self-Distillation

Crosslingual On-Policy Self-Distillation

PulseAugur coverage of Crosslingual On-Policy Self-Distillation — every cluster mentioning Crosslingual On-Policy Self-Distillation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-05-10 research_milestone Publication of a new method for improving multilingual reasoning in LLMs. 来源
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_27590 ·

    新方法增强大型语言模型在长上下文和多语言任务中的推理能力

    研究人员开发了新的方法来提高大型语言模型(LLM)的推理能力,特别是在长上下文和多语言任务方面。一种方法 OGLS-SD,在策略内自蒸馏过程中使用结果引导的logit引导来校准教师模型的响应,从而实现更稳定有效的推理。另一种方法 dGRPO,将策略内优化与蒸馏相结合,以增强长上下文推理,并引入了一个名为 LongBlocks 的新数据集。此外,COPSD 通过自蒸馏将高资源语言的推理行为转移到低资源语言,专门针对低资源语言,在多语言数…