实体
CoT prompting
CoT prompting
PulseAugur coverage of CoT prompting — every cluster mentioning CoT prompting across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的Agentic Critical Training方法提升了LLM代理的性能
研究人员推出了一种名为Agentic Critical Training (ACT) 的新方法,通过训练语言模型代理评估动作而非仅仅模仿动作来增强其能力。与传统的模仿学习不同,ACT使用具有可验证奖励的强化学习来教会模型区分专家动作和可能的错误。该方法在ALFWorld、WebShop和ScienceWorld等多个基准测试中表现出显著的改进,优于监督微调和CoT提示等现有方法。
-
新框架改进小型语言模型物理推理能力
研究人员开发了一个名为“Reason, Reward, Refine”的新框架,用于解决小型语言模型中的结构化推理错误,尤其是在物理学领域。该方法能够识别模型推理链中的第一个错误,并提供有针对性的反馈进行修正,而无需地面真实解决方案。该方法在物理学基准测试中显示出显著的准确性提升,大幅减少了计算和误解错误。