Casp
PulseAugur coverage of Casp — every cluster mentioning Casp across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的CASP方法使用可验证证书来改进NP难优化问题
一篇新研究论文介绍了一种名为CASP(Certificate-Augmented Solution Pruning,证书增强型解剪枝)的方法,该方法旨在利用机器学习预测来提高解决NP难优化问题的效率。与依赖未经检查的预测的传统方法不同,CASP包含一个可靠的多项式时间验证器,无论预测质量如何,都能确保正确性。此验证过程限制了诱导损失,使得证书参数的学习所需样本量远少于未经验证的方法。实验表明,当使用训练好的预测器时,CASP不会损失最…
-
RLVR 研究进展改进 LLM 推理和探索能力
两篇研究论文探讨了用于大型语言模型的可验证奖励强化学习 (RLVR) 的进展。第一篇论文从理论上分析了 RLVR 在推理任务上为何优于监督微调 (SFT),将思维链推理建模为路径查找,并证明了 RLVR 学习高效回溯的能力。第二篇论文通过提出候选感知支持保留 (CaSP) 方法来解决 RLVR 中的探索崩溃问题,该方法在顶级候选对象上保持概率质量,以提高在各种基准测试和模型尺寸上的性能。
-
新的ASP(Q)变体和FLINGO语言增强了AI约束编程
研究人员引入了“2-ASP(Q)^w”,一类具有两个量词和弱约束的新型回答集编程(ASP)程序,能够捕获高达Delta_3^P复杂度类的优化问题。这项工作为该类中的计算任务提供了完整的复杂度表征,并提出了一种使用反例引导抽象细化(CEGAR)技术计算量化回答集的新策略。实验评估证明了这些技术在挑战性基准上的有效性。此外,还开发了一种名为“flingO”的新语言和工具,将ASP的表达能力集成到线性整数约束中,从而增强了用于实际应用的约束…
-
CASP算法改进了两阶段推荐系统的离线策略选择
研究人员推出了一种用于两阶段推荐系统策略选择的新方法CASP(Coupled Action-Set Pessimism,耦合动作集悲观法)。该方法解决了初始物品生成器改变会同时改变估计策略值和支持该估计的数据的挑战。CASP结合了双重稳健值估计和弱数据支持的惩罚项,旨在通过考虑数据的可信度来选择更可靠的策略。