Chain Of Thought
PulseAugur coverage of Chain Of Thought — every cluster mentioning Chain Of Thought across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的VERA框架审计LLM漏洞推理中的虚假声明
一个名为漏洞解释推理审计器(Vulnerability Explanation Reasoning Auditor, VERA)的新框架已被开发出来,以解决大型语言模型(LLMs)在软件漏洞分析中提供看似合理但存在缺陷的推理问题。目前使用思维链(Chain-of-Thought)提示的方法常常导致LLMs捏造或掩盖逻辑错误。VERA引入了结构化推理记录(Structured Reasoning Record, SRR),要求LLMs输…
-
新型分层推理模型实现高级人工智能能力
研究人员推出了一种新颖的循环神经网络架构——分层推理模型(HRM),旨在增强人工智能的推理能力。与传统的思维链方法不同,HRM采用一个由抽象规划和详细计算组成的双模块系统,能够在没有明确中间监督的情况下,通过单次前向传播执行复杂任务。该模型仅有2700万个参数,在数独和迷宫导航等任务上表现出色,并在抽象与推理语料库(ARC)基准测试中超越了更大的模型,预示着通用推理系统取得了重大进展。
-
LLM用于抑郁严重程度的标准提取结果喜忧参半
一项新的研究论文评估了大型语言模型(LLM)如何从社交媒体帖子中提取抑郁严重程度的标准。该研究比较了直接评分与标记特定临床标准的方法,发现虽然标准提取更具可审计性,但其性能并不显著优于思维链提示,尤其是在阈值未预先拟合的情况下。即使经过重新校准,更高的同意度也未必能更好地检测到严重病例,标准提取有时会遗漏更严重的帖子。
-
新框架通过改进信用分配和效率来增强LVLM推理能力
两篇新研究论文提出了一种增强大型视觉语言模型(LVLM)推理能力的新型框架。第一篇论文PIVOT引入了一个双层学习框架,该框架使用自校准经验回放和视觉引导的优势分配来加强关键的视觉推理步骤。第二篇论文ReWAM专注于通用多模态嵌入的检索式推理,采用检索感知自蒸馏和检索自适应推理来提高准确性和效率。这两个框架都旨在使LVLM在大型部署中更有效、更实用。
-
新的 GRPO 方法在无需人类标签的情况下训练 NLI 模型
研究人员开发了一种使用群体相对策略优化 (GRPO)(一种强化学习方法)来训练自然语言推断 (NLI) 模型的新方法。该技术消除了对人类标注理由的需求,允许在 ANLI 等具有挑战性的数据集上训练模型。当使用 LoRA 和 QLoRA 等参数高效方法应用于 7B、14B 和 32B 语言模型时,GRPO 训练的模型在标准和对抗性 NLI 基准测试中表现出强大的性能。值得注意的是,32B 模型在对抗性数据集上的泛化能力优于监督基线,并且…
-
新研究表明,大型语言模型代理在市场行为方面不如人类高效
一项新的研究论文通过用大型语言模型(LLM)代理取代人类参与者来复制经济学实验,探讨了大型语言模型的市场行为。研究发现,与人类驱动的市场相比,由LLM代理组成市场向均衡收敛的速度较慢或根本不收敛,导致资源配置效率低下。对交易决策的分析揭示了不同模型家族和角色之间存在显著差异,在执行交易时,从战略调整转向紧迫性,这可以通过思维链(Chain-of-Thought)追踪来体现。
-
新的MIST方法使用内部Token显著性压缩LLM推理痕迹
研究人员开发了一种名为MIST(Model-Internal Saliency for Token-level CoT compression)的新方法,以降低大型语言模型(LLM)思维链(CoT)推理的计算成本。MIST通过分析其对模型内部“思想流”的影响,来识别和修剪不太重要的推理Token。它根据“必要性”(移除Token的贡献后答案质量下降的程度)和“充分性”(仅提供该Token的贡献后答案质量提高的程度)来衡量Token的重…
-
新的SHAPE框架解码大语言模型数学推理策略
研究人员开发了一个名为SHAPE的新框架,用于分析大语言模型(LLMs)在数学任务中的思维链(CoT)推理过程。SHAPE检查模型如何语义化地解释问题以及它们采用的具体数学启发式方法。该框架发现,模型使用的启发式方法比一般的CoT特征更能指示正确答案,并且将推理集中在更少的语义空间内可以带来更好的结果,这与人类行为相似。此外,SHAPE揭示了强化学习会鼓励特定的启发式方法使用,而一种促进多样化启发式方法的训练后方法提高了LLM的准确性。
-
新的FACE-Eval显示,基于工具的线索会降低AI推理的忠实度
一项名为FACE-Eval的新评估,包含5100个样本,旨在评估AI模型思维链(CoT)推理的忠实度。该评估改变了偏好线索的位置和明确性,发现当线索通过工具返回或隐式传递时,模型表现出较低的口头承诺和较高的隐藏采纳率,而不是直接在用户消息中传递。这表明,在偏好信息不那么明确的实际代理场景中,当前的CoT监控方法可能不太可靠。
-
新理论解释 Transformer 语义学习,提出跳过 CoT 的方法
一篇新的研究论文提出了一个框架,用于理解 Transformer 如何学习深度语义依赖,并识别出一种“梯度饥饿”现象,即在优化过程中,这些依赖的误差信号被抑制。这种抑制导致了结构化推理的相变,并解释了思维链(CoT)策略的有效性。研究人员在各种规模的 Transformer 上验证了他们的发现,包括 Llama-3.1-8B 和 Qwen2.5-Coder-7B 等生产模型,并开发了一种新的对比目标,与标准微调相比,在变量绑定任务上的…
-
新的PA-CoT方法增强了AI营养咨询的个性化和安全性
研究人员开发了一种名为PA-CoT(配置文件自适应思维链)的新提示方法,旨在提高AI驱动的营养咨询的个性化水平。该方法在生成响应之前,将配置文件解释明确地分离为一个独立的推理阶段,弥补了当前方法的不足。在Newly introduced QPA基准测试中,PA-CoT的表现优于其他11种方法,在个性化和安全性方面均取得了最高分。
-
新框架MemeGuard通过推理标注推进有害表情包检测
研究人员开发了MemeGuard,一个旨在改进有害表情包检测的新型多模态框架。该框架建立在MemeMind之上,这是一个新构建的大规模数据集,包含详细的思维链推理标注。MemeGuard采用三阶段训练过程,以增强其在视觉理解、多模态推理和有害内容辨别方面的能力,其表现优于现有的最先进方法。
-
UMER框架统一嵌入和排序以实现多模态检索
研究人员推出UMER,一个旨在统一嵌入和排序以实现通用多模态检索任务的新框架。该方法采用感知对的判别性推理,通过对比查询-候选对来识别相关的匹配和差异证据,这与以往孤立推理的方法不同。UMER在一个多模态大语言模型(MLLM)中联合学习用于高效全局匹配的对比嵌入和用于成对相关性判断的判别性排序。该框架在MMEB-V2基准测试中展示了最先进的性能。
-
新框架利用编辑判断对齐音频大语言模型以实现章节划分
研究人员开发了AudioChaps,一个用于对齐音频大语言模型(LALMs)以执行音频章节划分任务的训练后框架。该框架利用组相对策略优化(GRPO)和思维链(CoT)推理来改进LALMs将连续音频流分割成主题连贯章节的方式。为此,精心整理了三个新数据集——AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval,其中后者用作基准。使用此框架训练的AudioChaps-R1模型在章节划分任务…
-
OpenAI 发布内置思维链的“Strawberry”o1 推理模型
OpenAI 推出了一个代号为“Strawberry”且内部称为 o1 的新 AI 模型系列,这标志着其架构的重大转变。与预测下一个 token 的传统自回归模型不同,o1 作为一种“推理模型”运行,采用内部思维链(Chain-of-Thought, CoT)过程。这使得模型在生成最终输出之前能够进行逐步推理,从而增强其在复杂问题解决方面的能力,尤其是在 STEM 和编程领域。o1 的训练利用了强化学习来优化其内部推理策略,尽管这种方…
-
思维链解锁 Transformer 中的分支复杂性
研究人员开发了新的思维链(CoT)构造,展示了如何在 Transformer 中实现分支复杂性。这些构造利用硬注意力解码器,为深度优先搜索(DFS)和 Dijkstra 算法提供了明确的、有界深度的实现方法。该研究表明,CoT 可以在线性步骤中计算树的 Strahler 数,并将有序树与 Dyck 路径相关联,从而为有界深度 Transformer 的表达能力提供了新的见解。
-
新的CARE框架提升了医学VQA模型的可靠性和可信度
研究人员开发了CARE,一个旨在提高医学视觉问答(VQA)模型可靠性的框架。CARE解决了置信度失校准问题,即模型表达的确定性与其诊断准确性不符。该框架采用两阶段流程,包括使用合成的医学思维链数据进行监督微调,以及在组相对策略优化中引入新颖的置信度感知奖励机制,以更好地使置信度与正确性保持一致。在三个医学VQA基准上的评估表明,CARE在提高诊断准确性的同时,降低了校准误差和幻觉率,为更值得信赖的临床决策支持工具铺平了道路。
-
LLM辅助框架提升硬件设计测试与调试效率
研究人员开发了LAUDE框架,该框架利用大型语言模型(LLMs)辅助生成单元测试和调试硬件设计。通过将LLMs的链式思考推理与设计执行信息相结合,LAUDE旨在提高测试生成的准确性和调试的效率。在VerilogEval数据集的有缺陷硬件设计代码上进行应用,LAUDE成功检测出多达100%组合逻辑设计的缺陷,并调试了其中高达93%的设计。
-
新研究探索大型语言模型中的递归和隐式推理
两篇新研究论文探讨了改进大型语言模型(LLMs)隐式推理的方法。第一篇论文介绍了“递归深度 Transformer”,它通过在相同的 Transformer 层上进行迭代计算来增强组合泛化能力。第二篇论文提出了“ReLIT”(递归隐式 Transformer),一个框架,通过添加一个可训练的递归块来增强一个固定的 LLM,在输出前优化潜在思维,旨在弥合符号推理与自然语言连贯性之间的差距。
-
代码驱动的推理框架增强文本到图像生成
研究人员推出了一种新颖的文本到图像生成框架 CoCo (Code-as-CoT),该框架利用可执行代码来表示推理过程。与传统的自然语言推理相比,这种方法能够对复杂的视觉元素和结构化内容进行更精确的规划。CoCo 生成代码来创建草图图像,然后通过编辑进行细化以生成最终输出。该框架在各种基准测试中表现出显著的改进,优于直接生成和其他思维链方法。