CISPO
PulseAugur coverage of CISPO — every cluster mentioning CISPO across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现:AI 模型在未见过的任务上会陷入“泛化陷阱”
本文详细介绍了多奖励强化学习基准测试的第二部分,重点关注不同算法在未见过的任务上的表现。该研究在去中心化交易所套利环境中,使用 Qwen3-14B 模型测试了包括 CISPO 和 DAPO 在内的七种强化学习算法。结果显示,尽管 CISPO 获得了很高的训练奖励,但其在冻结测试任务上的表现与未经训练的基线模型相比显著下降,突显了潜在的“泛化陷阱”,即训练指标可能具有误导性。
-
Qwen3 14B 模型实验比较强化学习技术 · 跟踪 2 个来源
对 Qwen3 14B 模型进行了实验,以评估各种强化学习技术,包括 GRPO、DAPO++、CISPO、Adapoides 和 REPO-RECK。该研究侧重于比较这些方法是否包含“思考”组件,并展示了完整的留存结果、奖励曲线和资源使用数据。研究还涉及了网络抓取和多账户管理等高风险自动化任务。
-
Mistral AI发布Leanstral 1.5,用于高级形式化验证
Mistral AI发布了Leanstral 1.5,这是一个开源模型,专为形式化验证任务设计。该模型拥有60亿活跃参数,并以Apache 2.0许可证提供,在解决复杂数学问题和验证真实世界代码方面表现出显著的改进。Leanstral 1.5在证明工程等领域表现出色,并已在软件存储库中发现了一些先前未知的错误。
-
新的RLVR方法ACPO增强了LLM的推理能力
研究人员分析了来自可验证奖励的强化学习(RLVR),以了解其对大型语言模型推理的影响。他们的理论分析表明,由每次rollout的梯度步数影响的离策略学习程度,通过影响重要性采样比率和裁剪行为,显著改变了更新动态。基于此,他们提出了自适应裁剪策略优化(ACPO),该方法动态调整裁剪边界。实验表明,ACPO在使用3B和7B模型进行的各种推理任务上优于DAPO和CISPO等现有方法。