On-Policy Delta Distillation
PulseAugur coverage of On-Policy Delta Distillation — every cluster mentioning On-Policy Delta Distillation across labs, papers, and developer communities, ranked by signal.
-
New distillation technique boosts multilingual math reasoning in LLMs
Researchers have explored On-Policy Delta Distillation (OPD^2), an advancement over On-Policy Distillation (OPD), for multilingual mathematical reasoning. Experiments using the Qwen3 model demonstrated that OPD^2 signif…
-
New On-Policy Delta Distillation method enhances LLM reasoning capabilities
Researchers have introduced a novel method called On-Policy Delta Distillation (OPD^2) to improve the transfer of reasoning capabilities in large language models. This technique utilizes a "delta signal," which represen…
-
New distillation methods enhance multimodal AI reasoning capabilities
Researchers have developed new on-policy distillation techniques to improve multimodal AI models. The OPOD method routes student responses to modality-specific teachers, achieving state-of-the-art results across various…