实体
Test-Time Policy Optimization
Test-Time Policy Optimization
PulseAugur coverage of Test-Time Policy Optimization — every cluster mentioning Test-Time Policy Optimization across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的TTPO方法在无标签情况下增强LLM数学推理能力
研究人员开发了一种名为测试时策略优化(TTPO)的新颖方法,用于在不依赖真实标签的情况下提高大型语言模型的数学推理能力。TTPO通过采用一种不对称目标来解决使用多数投票伪标签的脆弱性,该目标会蒸馏同意的展开并惩罚不同意的展开。这种方法包括用于精炼的token级选择,在基准测试中表现出色,显著提高了Qwen3-1.7B模型的准确性,并显示出强大的跨任务泛化能力。
-
新的TTPO方法在无标签情况下增强LLM推理能力
研究人员开发了测试时策略优化(TTPO)这一新方法,可在不依赖真实标签的情况下提高大型语言模型的数学推理能力。TTPO通过采用一种区分正确预测和错误预测的不对称目标函数,解决了伪标签的脆弱性问题。这种方法实现了有效的测试时训练,在基准测试中达到了监督学习的性能水平,并显著增强了Qwen3-1.7B等模型的能力。