PulseAugur
实时 11:34:18
实体 TCPO

TCPO

PulseAugur coverage of TCPO — every cluster mentioning TCPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_190048 ·

    新的TCPO方法改进了多轮对话中的LLM推理能力

    研究人员推出了一种新颖的TCPO方法,用于大型语言模型在验证器引导下的强化学习中的轮次信用分配。该方法旨在通过关注每一轮对精炼轨迹的影响,而不是仅仅关注输出的即时质量,来改进模型从反馈中学习的方式。实验表明,TCPO在包括数学推理、代码生成和代理任务在内的各种任务上都提高了性能,在Qwen3-4B和DeepSeek-R1-Distill-Llama-8B等模型上,在Pass@8等基准测试中取得了具有竞争力或更优的结果。