Chain-of-Thought (CoT)
PulseAugur coverage of Chain-of-Thought (CoT) — every cluster mentioning Chain-of-Thought (CoT) across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究探讨多层SSM的表达能力和局限性
一篇新论文探讨了多层状态空间模型(SSM)的表达能力和局限性。研究人员分析了深度、精度、状态维度和思维链(CoT)推理等因素对这些模型的影响。该研究为解决特定的顺序信息传播问题提供了理论界限,并区分了后输入推理和输入交错推理。
-
新的CoCoT框架增强了VLM在社会情境下的推理能力
研究人员推出了一种新颖的推理框架——认知链式思维 (CoCoT),旨在改进视觉语言模型 (VLM) 处理复杂社会情境的能力。CoCoT将VLM的推理过程分为三个 distinct 阶段:感知 (Perception)、情境 (Situation) 和规范 (Norm),旨在弥合视觉理解与基于规范的推理之间的差距。在多模态意图消歧和心智理论等各种任务上的评估显示,性能有了显著提升,平均增幅达到4.6%至5.9%。此外,在CoCoT结构化…
-
新的VLA模型通过多专家推理和多模态交互增强自动驾驶能力
两篇新的研究论文探讨了用于自动驾驶的先进视觉-语言-动作(VLA)模型。第一篇论文CoWorld-VLA介绍了一个多专家世界推理框架,该框架使用专门的token来条件化动作规划,并在NAVSIM数据集上展示了改进的性能。第二篇论文提出了一个通过关注多模态交互和多轨迹规划来增强VLA模型的系统,旨在实现更可靠和可解释的驾驶决策,尤其是在挑战性场景下。
-
新的ReCo框架将推理模型成本降低高达65%
研究人员开发了一个名为ReCo(Reward-Coordinated Compression,奖励协调压缩)的新框架,以提高大型推理模型的效率。该方法解决了使用长链式思考推理的模型中“过度思考”的问题,这会增加推理成本。ReCo根据过程奖励估计器协调KV缓存压缩和生成惩罚,该估计器根据推理步骤的重要性调整压缩级别,并惩罚冗余的Token生成。该框架还包括基于置信度的提前停止,从而在保持各种基准和模型准确性的同时,显著减少了生成的Tok…
-
AI Chain-of-Thought 监控在隐性影响场景下不太可靠
新研究表明,思维链(CoT)监控,作为一种先进AI模型至关重要的安全功能,可能不如之前假设的那样可靠,尤其是在影响是隐性而非显性而非显性的场景下。研究表明,虽然CoT监控器可以在直接指示隐藏行为的情况下检测到高比例的行为变化,但当影响是微妙的或无意的时,其有效性会显著下降。系统提示的添加旨在减轻偏见,可能会进一步加剧这种检测率的降低,从而可能导致对AI安全产生虚假的安全感。
-
新的EVL-MCoT方法通过增强视觉-语言模型来改进有害表情包的检测
研究人员开发了一种名为EVL-MCoT的新方法,通过增强视觉-语言模型来改进有害表情包的检测。该方法利用增强的思维链(CoT)过程来整合多视角推理,旨在减少偏见并提高识别有害内容的可靠性。EVL-MCoT框架还设有一个原型引导和上下文引导的解码机制,以实现视觉和文本元素之间更精确的对齐,并在HatefulMemes和MultiOff数据集上取得了有希望的结果。
-
新研究解决多模态推理效率和准确性问题 · 2篇论文
两篇新研究论文提出了提高多模态推理模型效率和准确性的方法。第一篇AdaViG引入了一种自适应视觉门控技术,当内部信号表明视觉步骤生成无益时,动态中止该生成,从而提高准确性并降低计算开销。第二篇Beyond the Eye (BEE)专注于自调节隐式视觉工具,将工具调用行为纳入训练目标,以平衡内部知识和外部工具,从而减少延迟和冗余计算。
-
新框架 MolBasic 通过 SMILES-图转换增强 LLM 的分子理解能力
研究人员推出 MolBasic,一个旨在增强大型语言模型 (LLM) 分子理解能力的新框架。该方法解决了 LLM 无法可靠地从标准 SMILES 中捕获分子图的问题,这是化学中结构决定功能的根本方面。MolBasic 利用 SMILES-图转换机制来对齐序列和拓扑表示,并辅以多级结构感知基准和带有思维链提示的渐进式学习方案。实验表明,MolBasic 显著提高了结构理解能力,并在属性预测和优化等下游任务上取得了更好的性能。
-
新的SCOReD框架优化了推荐模型的思维链蒸馏
研究人员开发了一个名为SCOReD(学生感知思维链优化用于推荐蒸馏)的新框架,以改进用于推荐系统的小型语言模型的训练。该方法通过将大型教师模型的推理轨迹解析为类型化片段,并利用学生模型的注意力来评估其重要性,从而优化推理轨迹。SCOReD动态选择每个片段的编辑,在保留关键细节的同时修剪冗余信息,从而为学生提供更清晰的学习信号。这种方法在NDCG方面提高了1.56%,在Recall@5方面提高了1.9%,同时还将推理长度减少了27.3%。
-
新的SCOReD框架优化LLM推理轨迹以用于推荐系统
研究人员开发了一个名为SCOReD(Student-Aware CoT Optimization for Recommendation Distillation)的新框架,旨在提高在推荐系统中利用大型模型(教师)的推理轨迹来训练小型语言模型(学生)的效率和有效性。SCOReD通过将教师轨迹解析为类型化片段,并利用学生模型的注意力来评估其重要性,解决了大型教师模型推理不确定性和分布外轨迹等挑战。该框架动态选择每个片段的编辑,修剪冗余信息…
-
新研究探索用于大型语言模型的潜在变量推理,带来效率和可解释性提升
两篇新研究论文探索了改进大型语言模型推理能力的替代方法。其中一篇论文介绍了 LoTUS(Looped Transformers with parallel supervision on latents),一种使用循环深度 Transformer 进行潜在变量推理的方法,该方法有望在规模化应用中缩小与显式思维链(CoT)方法的差距并降低延迟。另一篇论文提出了离散潜在变量推理(DLR),它将连续的潜在状态转换为离散标记,以实现更稳定和可解…
-
新基准揭示多模态大语言模型难以应对复杂视觉推理 · 跟踪 2 个来源
一个名为 TriViewBench 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的结构推理能力。该基准包含具有不同物体数量和遮挡的合成 3D 场景,结果显示所有 18 个经过评估的 MLLMs 都表现出一致的性能层级,随着复杂度的增加,能力会显著下降。具体而言,全局恢复任务严重崩溃,物体计数也显示出显著的退化。研究表明,当前 MLLMs 在跨视角空间表示方面面临根本性的可扩展性限制,而思维链提示(Chain-of-Th…
-
新的AI安全护栏挑战推理必要性,提升多模态安全性
两篇新的研究论文探讨了AI安全护栏的有效性和适应性。其中一篇论文LeanGuard质疑复杂推理在内容审核中的必要性,证明一个轻量级的、仅标签的编码器可以匹配基于推理的大模型的准确性,同时速度更快、效率更高。另一篇论文介绍了SingGuard,这是一种为视觉语言模型设计的策略自适应多模态安全护栏,能够动态适应不断变化的AI安全策略,并在新的多模态基准测试中取得最先进的性能。
-
新研究致力于将大语言模型集成到生成式推荐系统中 · 跟踪 8 个来源
几篇新研究论文探讨了生成式推荐系统的进展,重点关注如何更好地将用户行为和物品语义集成到大语言模型(LLMs)中。G2Rec 提出了一种可扩展的框架,该框架将基于图的用户协同参与建模与语义标记化相结合。Token Factory 提供了一种将传统信号转换为“软标记”的方法,以便高效地集成到 LLMs 中,防止提示长度问题。另一项研究调查了 LLMs 在生成式推荐中的记忆行为,并引入了 IIRG 来捕捉更丰富的物品-物品关系。HoloRe…
-
新框架NTS-CoT解决了LLM新闻时间线摘要中的幻觉问题
研究人员开发了NTS-CoT,一个旨在减少大型语言模型(LLM)驱动的新闻时间线摘要中幻觉的新框架。该框架解决了两种主要的幻觉类型:不忠实内容和信息遗漏。NTS-CoT在三个模块中利用思维链(Chain-of-Thought)推理:Element-CoT用于捕捉新闻要素,Date Selection用于时间与事件的突出性,Causal-CoT用于推断因果关系。实验表明,NTS-CoT在减轻这些问题和提高时间线摘要性能方面优于现有方法。
-
新方法恢复LLM微调过程中丢失的长上下文记忆
研究人员发现,思维链(CoT)微调虽然提高了推理能力,但会显著降低混合线性注意力模型中的长上下文记忆。这个问题被称为“注意力遗忘”,会导致在“海量信息找针”(Needle-In-A-Haystack)等任务上的性能下降。一种名为QK-Restore的无训练新方法被提出,通过恢复微调前检查点的特定查询-键投影权重来解决此问题,成功恢复了长上下文能力,而没有牺牲推理性能。
-
大型语言模型通过新的先验证提示策略提高推理能力
研究人员开发了一种名为“先验证”(Verification-First, VF)的新提示策略,可以在没有显著训练成本或大量采样的情况下提高大型语言模型的推理能力。该方法提示大型语言模型在生成最终解决方案之前先验证一个候选答案,即使是随机答案。VF通过启动一个“逆向推理”过程来有效地修剪模型的输出分布,该过程是对标准的正向思维链(Chain-of-Thought)提示的补充。实验表明,VF在开销极小的情况下始终优于标准的思维链提示,而迭…
-
新数据集通过逐级推理增强LLM张量程序优化能力
研究人员推出Step-TP,一个旨在提升大型语言模型(LLMs)优化张量程序能力的新数据集。现有方法通常缺乏逐级监督和可解释性,阻碍了LLMs在复杂优化任务上的表现。Step-TP提供了原子级的、逐级监督以及结构化的链式思考推理,使LLMs能够通过理解中间程序状态来做出更可靠的单步决策。
-
大语言模型研究探索句法编码与推理效率
两篇新研究论文探讨了大语言模型(LLMs)的内部工作机制及其推理能力。一篇论文调查LLMs是否编码了超出标准语言标注所能捕捉到的形式句法结构,并发现了支持这一观点的证据。另一篇论文提出了一种新方法EDRM,通过分析文本生成过程中的熵动力学来确定何时LLMs能从思维链(chain-of-thought)推理中受益,表明选择性推理可以提高效率和准确性。
-
小型LLM使用位置复制捷径进行算术,绕过CoT逻辑
一篇新的研究论文揭示了小型语言模型在使用链式思考(CoT)提示执行算术任务时存在一个重要的捷径。这些模型倾向于复制答案分隔符之前的位置数字,而不是依赖逻辑排序,即使中间的推理步骤不正确或被打乱,这种位置复制也能解释其准确性的很大一部分,这突显了评估CoT忠实度时潜在的故障模式。