研究人员开发了一种名为测试时策略优化(TTPO)的新方法,以提高大型语言模型的数学推理能力。与需要真实标签的先前方法不同,TTPO在测试期间利用伪标签和非对称目标来优化模型的性能。这种方法允许模型从自己的预测中学习,即使这些预测与多数投票不同,从而在没有外部监督的情况下显著提高了各种基准测试的性能。 AI
影响 该方法可以通过减少对复杂任务(如数学推理)的标记数据依赖,从而实现更高效、更具适应性的LLM训练。
排序理由 该集群描述了一篇详细介绍改进LLM能力的新颖方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- large language models
- On-Policy Self-Distillation
- Qwen3 1.7B
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →