研究人员开发了一种名为测试时策略优化(TTPO)的新颖方法,用于在不依赖真实标签的情况下提高大型语言模型的数学推理能力。TTPO通过采用一种不对称目标来解决使用多数投票伪标签的脆弱性,该目标会蒸馏同意的展开并惩罚不同意的展开。这种方法包括用于精炼的token级选择,在基准测试中表现出色,显著提高了Qwen3-1.7B模型的准确性,并显示出强大的跨任务泛化能力。 AI
影响 该方法通过减少对标记数据的依赖,可以实现更高效和更具适应性的LLM训练,从而可能提高在数学推理等专业任务上的性能。
排序理由 该条目描述了一篇介绍改进LLM性能新方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Grouped RL
- large-language models
- On-policy self-distillation
- Qwen3 1.7B
- reinforcement learning
- Test-Time Policy Optimization
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →