PulseAugur
实时 06:52:04
实体 Large Reasoning Models

Large Reasoning Models

PulseAugur coverage of Large Reasoning Models — every cluster mentioning Large Reasoning Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 41
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 41
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-08 research_milestone A research paper demonstrates that frontier Large Reasoning Models (LRMs) exhibit behavioral and brain alignment with human game learners. 来源
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 41 条
  1. TOOL · CL_233414 ·

    AI数学家框架旨在实现前沿数学研究的自动化

    研究人员开发了一个名为AI数学家(AIM)的AI框架,旨在利用大型推理模型(LRMs)支持前沿数学研究。AIM通过探索更长解决方案路径的机制和用于可靠性的悲观合理验证方法,解决了研究问题所需的复杂性和程序严谨性。早期实验表明,AIM能够自主构建大部分证明,并在各种数学主题中发现非平凡的见解,预示着加速数学发现的潜力。

  2. TOOL · CL_221130 ·

    研究发现:AI代理的推理增强了说服力,但容易被长度欺骗

    一篇新的arXiv论文探讨了大型推理模型(LRMs)中显式的“思考”过程对其说服能力的影响。研究人员发现,虽然推理增强了代理说服他人和抵制错误说服的能力,但这种有效性可能被回应长度和重复等表面线索所削弱,而非逻辑有效性。研究还揭示了多代理系统中的说服动态是非线性的,并提出了一种提高代理抵御对抗性论证能力的方法。

  3. TOOL · CL_218198 ·

    新框架增强大型推理模型以实现个性化生成

    一篇新的研究论文探讨了大型推理模型(LRMs)在个性化任务中的应用,发现虽然LRMs可以生成更多token,但在检索密集型场景下,它们的表现并不总是优于通用LLMs。该论文指出了发散性思维和检索信息利用效率不高等局限性。为了解决这些问题,研究人员提出了一个名为“面向个性化的强化推理”(Reinforced Reasoning for Personalization,简称“model”)的新框架,该框架使用分层推理思维模板和交叉引用机制…

  4. TOOL · CL_217924 ·

    新框架使用布鲁姆分类法分析大型推理模型的推理过程

    研究人员开发了一个新框架,通过应用布鲁姆分类法来分析大型推理模型(LRM)的推理过程。该分类法将认知思维分为六个层次,例如记忆、应用和评估。使用该框架进行的大规模分析揭示了不同模型和任务之间存在不同的思维模式。研究还表明,理解这些思维类型与模型的正确性相关,这表明有可能提高大型推理模型的推理质量。

  5. TOOL · CL_210459 ·

    新的SM Trap方法能够实现针对大型推理模型的低成本DoS攻击

    研究人员开发了一种名为SM Trap的新方法,能够针对大型推理模型(LRM)发起低成本的拒绝服务(DoS)攻击。该技术通过利用可满足性模理论(SMT)求解器的冲突计数来指导创建计算密集型查询,从而绕过了直接模型反馈或训练单独攻击模型的需要。研究发现,更高的SMT冲突计数与LRM中增加的回溯搜索相关,导致更长的输出生成时间。SM Trap是一个仅CPU的框架,在七个前沿模型上展示了比现有方法显著更强的DoS效果,同时还展示了一种减少令牌…

  6. RESEARCH · CL_208646 ·

    新的AI方法增强图表理解和编辑能力

    研究人员开发了新的方法来改进多模态大型语言模型(MLLMs)理解和交互图表的方式。一种方法CharTool集成了外部工具进行视觉感知和基于代码的计算,增强了数值推理和接地能力。另一种方法REChart通过优化中间推理步骤和减轻模型的“过度思考”来专注于高效的图表编辑。这两种方法在图表相关基准测试中都显示出显著的改进,优于现有基线,并取得了与更大模型相媲美的结果。

  7. TOOL · CL_205933 ·

    Funnel of Thoughts 方法将 LRM 推理成本减半

    研究人员开发了一种名为 Funnel of Thoughts (FoT) 的新推理时间方法,旨在提高大型推理模型 (LRM) 的效率。该技术旨在通过分析模型轨迹中的犹豫信号(如“Wait”和“Actually”),这些信号通常表明模型正在挣扎或陷入循环,从而识别并剪除无效的轨迹,同时保持多模型轨迹的多数投票准确性,并显著降低计算成本。FoT 在无需额外模型推理或重新训练的情况下,已证明能大幅减少注意力 FLOPs 和生成时间,并且该词…

  8. TOOL · CL_193665 ·

    新的ROM框架减少AI过度思考,大幅缩短响应时间

    研究人员开发了ROM(实时过度思考缓解),一个新颖的框架,旨在防止大型推理模型(LRMs)在达到正确解决方案后进行不必要的计算。ROM利用一个轻量级的隐藏状态检测器,在格式良好的推理边界进行识别和干预,有效缓解“过度思考”,而无需提取中间答案或更新模型权重。这种方法在各种基准测试和模型家族中,将响应长度最多减少77%,同时保持或提高准确性,从而大幅降低实际运行时间延迟。

  9. TOOL · CL_193297 ·

    新的Gambit算法优化大型推理模型的计算

    研究人员推出了一种新颖的推理算法Gambit,旨在优化大型推理模型(LRM)的计算分配。Gambit采用思维级束搜索策略,通过剪枝不具前景的路径并从高质量前缀分支,动态地将计算资源集中在最有前景的推理链上。该方法旨在克服传统并行采样和减法剪枝方法的低效率。在HMMT-24和AIME-25等基准测试上的评估表明,与现有基线相比,Gambit在准确性、吞吐量和减少令牌消耗方面均取得了显著的提升。

  10. RESEARCH · CL_193290 ·

    新研究应对大语言模型推理、效率和蒸馏挑战 · 跟踪 10 个来源

    新研究探索了提高大语言模型(LLMs)推理能力和效率的方法。一篇论文引入了“Trace as State”,通过将推理痕迹置于上下文块之前来增强长上下文推理,在各种模型和数据集上显示出显著的性能提升。另一项研究提出了“SALA”,用于上下文学习中的语义感知逻辑对齐,改进了复杂推理任务的演示选择。此外,关于“HEAL”的研究旨在通过解决当前蒸馏技术的局限性,从 LLMs 中将推理蒸馏到更小的模型中,其灵感来源于教育理论。

  11. TOOL · CL_183146 ·

    TQLite框架赋能小型语言模型进行实时翻译质量评估

    研究人员开发了TQLite,一个新颖的蒸馏框架,旨在使小型语言模型(SLMs)能够执行翻译质量(TQ)评估,其性能可与更大、计算成本更高的模型相媲美。该框架利用多大型推理模型(LRMs)陪审团来生成合成训练数据并汇总评估响应。该研究对包括SLMs、LLMs和LRMs在内的各种模型进行了基准测试,以建立TQ评估的最佳实践,并证明TQLite训练的SLMs为实时评估提供了可扩展且经济高效的替代方案。

  12. TOOL · CL_183086 ·

    新数据集衡量人工智能忠实度与安全性的张力

    研究人员在大型推理模型(LRMs)中发现了忠实度与安全性之间的张力,模型需要忠实于其推理过程以进行监控,同时又要足够鲁棒以拒绝不安全输出。一个名为 HazMart 的新数据集被引入,用于衡量这种张力,该数据集是为人工智能店员场景设计的。研究发现 DeepSeek-R1-Llama-70B 表现出高忠实度但安全性差,而 QwQ-32B 在牺牲较低忠实度的情况下表现出更好的安全性。进一步分析表明,表示法引导可以独立地增强安全性,而不会损害核心能力。

  13. TOOL · CL_180578 ·

    AI代理Intern-S1-MO攻克奥赛级别数学难题

    研究人员开发了Intern-S1-MO,这是一种新颖的长时域推理代理,旨在解决奥赛级别的复杂数学问题。该代理采用多轮、分层推理方法,使用相互连接的大型推理模型(LRM)系统进行推理、摘要和验证。通过维护一个紧凑的引理记忆,Intern-S1-MO可以在多个阶段探索广泛的推理空间,克服了标准LRM的上下文长度限制。该系统使用一种新的强化学习框架OREAL-H进行训练,该框架同时增强了LRM的推理能力和代理的整体性能。实验表明,Inter…

  14. TOOL · CL_167185 ·

    掩码蒸馏训练大型语言模型内化推理步骤

    研究人员开发了一种名为掩码蒸馏的新方法,用于训练语言模型内化推理的计算步骤,从而降低延迟和成本。该技术训练学生模型仅预测最终答案,并利用提供推理轨迹的教师模型的反馈。在算术和数字谜题任务上的实验表明,该方法能有效地将推理过程浓缩到模型参数中。

  15. RESEARCH · CL_165135 ·

    新研究着眼于法律、多模态和通用文本生成中的大型语言模型幻觉问题

    多篇在arXiv上发表的研究论文探讨了检测和减轻大型语言模型(LLM)幻觉的方法。一项研究对法律幻觉检测进行了基准测试,发现虽然GPT-5等较新模型有所改进,但它们在细微的错误类别上仍有困难,并且需要资源密集型的验证。另一篇论文介绍了HallDetect,一个用于各种生成任务的无参考幻觉检测框架。其他研究侧重于引发内在幻觉的对抗性攻击、神经多样性在减少幻觉中的作用,以及大型视觉语言模型中的特定模式。此外,还提出了一个新的基准KnowH…

  16. TOOL · CL_154078 ·

    新的PUMA框架诊断并纠正大型语言模型的推理错误

    研究人员推出了一种新颖的PUMA框架,旨在诊断和解决大型推理模型(LRMs)中的推理病理。PUMA基于新提出的相位-动量对齐假说(Phase-Momentum Alignment Hypothesis),该假说认为准确的推理依赖于几何动量和不确定性消解之间的同步交互。该框架利用认知能量模型(Cognitive-Energy Model)量化这些动态,并采用分层诊断架构来区分主动探索和被动停滞,从而实现自适应干预。实验表明,PUMA在各…

  17. RESEARCH · CL_131328 ·

    新的MARGO框架解决了大型推理模型中的事实幻觉问题

    研究人员开发了MARGO,一个新颖的强化学习框架,旨在减轻大型推理模型(LRMs)中的事实幻觉。MARGO解决了“思维诱导幻觉”问题,即显式推理步骤有时会导致错误答案。通过比较思维和非思维轨迹,MARGO识别显式思维是否增加了事实价值,从而抑制无益的推理,同时保留有益的思维过程。实验表明,MARGO在QA基准测试中提高了事实可靠性,而不会损害数学任务上的通用推理能力。

  18. TOOL · CL_111705 ·

    新的HauntAttack方法利用大型AI模型的推理漏洞

    研究人员开发了HauntAttack,这是一个旨在利用大型推理模型(LRM)中漏洞的新框架。这种攻击方法将有害指令嵌入基于推理的问题中,引导模型产生不安全的输出。在对11个LRM的测试中,HauntAttack的平均成功率超过70%,与先前的方法相比有了显著提高,并凸显了在AI开发中平衡高级推理能力与强大安全措施的持续挑战。

  19. RESEARCH · CL_111581 ·

    新的ReaORE框架通过推理增强开放关系抽取

    研究人员推出了一种新颖的ReaORE框架,旨在通过采用粗粒度到细粒度的推理方法来改进开放关系抽取(OpenRE)。该方法解决了现有技术(如聚类)在泛化和标签生成方面的局限性,以及直接使用LLM方法缺乏区分相似关系的能力等问题。ReaORE的两阶段过程包括基于多方面推理和嵌入相似性的关系过滤,然后进行细粒度的比较推理以进行关系预测。在标准数据集上的实验表明,ReaORE在抽取未见过关系方面优于当前基线。

  20. RESEARCH · CL_109180 ·

    研究发现,大型语言模型和人类在解决问题策略上存在分歧 · 已追踪 7 个来源

    新研究表明,尽管人类和大型语言模型(LLMs)都会根据问题的难度调整解决时间,但其内部机制却存在显著差异。人类倾向于放弃那些他们认为困难或可能出错的问题,而大型语言模型则会在更难的问题上花费更多的计算资源,但这常常导致错误。这种“审议分配”上的分歧表明,大型语言模型在困难任务上延长处理时间源于不确定性,而非像人类那样进行战略性投入。