PulseAugur
实时 01:05:25
实体 Chain-of-Thought (CoT)

Chain-of-Thought (CoT)

PulseAugur coverage of Chain-of-Thought (CoT) — every cluster mentioning Chain-of-Thought (CoT) across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 14
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. RESEARCH · CL_141291 ·

    新研究解决多模态推理效率和准确性问题 · 2篇论文

    两篇新研究论文提出了提高多模态推理模型效率和准确性的方法。第一篇AdaViG引入了一种自适应视觉门控技术,当内部信号表明视觉步骤生成无益时,动态中止该生成,从而提高准确性并降低计算开销。第二篇Beyond the Eye (BEE)专注于自调节隐式视觉工具,将工具调用行为纳入训练目标,以平衡内部知识和外部工具,从而减少延迟和冗余计算。

  2. TOOL · CL_128781 ·

    新框架 MolBasic 通过 SMILES-图转换增强 LLM 的分子理解能力

    研究人员推出 MolBasic,一个旨在增强大型语言模型 (LLM) 分子理解能力的新框架。该方法解决了 LLM 无法可靠地从标准 SMILES 中捕获分子图的问题,这是化学中结构决定功能的根本方面。MolBasic 利用 SMILES-图转换机制来对齐序列和拓扑表示,并辅以多级结构感知基准和带有思维链提示的渐进式学习方案。实验表明,MolBasic 显著提高了结构理解能力,并在属性预测和优化等下游任务上取得了更好的性能。

  3. TOOL · CL_139331 ·

    新的SCOReD框架优化了推荐模型的思维链蒸馏

    研究人员开发了一个名为SCOReD(学生感知思维链优化用于推荐蒸馏)的新框架,以改进用于推荐系统的小型语言模型的训练。该方法通过将大型教师模型的推理轨迹解析为类型化片段,并利用学生模型的注意力来评估其重要性,从而优化推理轨迹。SCOReD动态选择每个片段的编辑,在保留关键细节的同时修剪冗余信息,从而为学生提供更清晰的学习信号。这种方法在NDCG方面提高了1.56%,在Recall@5方面提高了1.9%,同时还将推理长度减少了27.3%。

  4. RESEARCH · CL_131485 ·

    新的SCOReD框架优化LLM推理轨迹以用于推荐系统

    研究人员开发了一个名为SCOReD(Student-Aware CoT Optimization for Recommendation Distillation)的新框架,旨在提高在推荐系统中利用大型模型(教师)的推理轨迹来训练小型语言模型(学生)的效率和有效性。SCOReD通过将教师轨迹解析为类型化片段,并利用学生模型的注意力来评估其重要性,解决了大型教师模型推理不确定性和分布外轨迹等挑战。该框架动态选择每个片段的编辑,修剪冗余信息…

  5. RESEARCH · CL_117344 ·

    新研究探索用于大型语言模型的潜在变量推理,带来效率和可解释性提升

    两篇新研究论文探索了改进大型语言模型推理能力的替代方法。其中一篇论文介绍了 LoTUS(Looped Transformers with parallel supervision on latents),一种使用循环深度 Transformer 进行潜在变量推理的方法,该方法有望在规模化应用中缩小与显式思维链(CoT)方法的差距并降低延迟。另一篇论文提出了离散潜在变量推理(DLR),它将连续的潜在状态转换为离散标记,以实现更稳定和可解…

  6. RESEARCH · CL_109506 ·

    新基准揭示多模态大语言模型难以应对复杂视觉推理 · 跟踪 2 个来源

    一个名为 TriViewBench 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的结构推理能力。该基准包含具有不同物体数量和遮挡的合成 3D 场景,结果显示所有 18 个经过评估的 MLLMs 都表现出一致的性能层级,随着复杂度的增加,能力会显著下降。具体而言,全局恢复任务严重崩溃,物体计数也显示出显著的退化。研究表明,当前 MLLMs 在跨视角空间表示方面面临根本性的可扩展性限制,而思维链提示(Chain-of-Th…

  7. RESEARCH · CL_106814 ·

    新的AI安全护栏挑战推理必要性,提升多模态安全性

    两篇新的研究论文探讨了AI安全护栏的有效性和适应性。其中一篇论文LeanGuard质疑复杂推理在内容审核中的必要性,证明一个轻量级的、仅标签的编码器可以匹配基于推理的大模型的准确性,同时速度更快、效率更高。另一篇论文介绍了SingGuard,这是一种为视觉语言模型设计的策略自适应多模态安全护栏,能够动态适应不断变化的AI安全策略,并在新的多模态基准测试中取得最先进的性能。

  8. RESEARCH · CL_90857 ·

    新研究致力于将大语言模型集成到生成式推荐系统中 · 跟踪 8 个来源

    几篇新研究论文探讨了生成式推荐系统的进展,重点关注如何更好地将用户行为和物品语义集成到大语言模型(LLMs)中。G2Rec 提出了一种可扩展的框架,该框架将基于图的用户协同参与建模与语义标记化相结合。Token Factory 提供了一种将传统信号转换为“软标记”的方法,以便高效地集成到 LLMs 中,防止提示长度问题。另一项研究调查了 LLMs 在生成式推荐中的记忆行为,并引入了 IIRG 来捕捉更丰富的物品-物品关系。HoloRe…

  9. RESEARCH · CL_86667 ·

    新框架NTS-CoT解决了LLM新闻时间线摘要中的幻觉问题

    研究人员开发了NTS-CoT,一个旨在减少大型语言模型(LLM)驱动的新闻时间线摘要中幻觉的新框架。该框架解决了两种主要的幻觉类型:不忠实内容和信息遗漏。NTS-CoT在三个模块中利用思维链(Chain-of-Thought)推理:Element-CoT用于捕捉新闻要素,Date Selection用于时间与事件的突出性,Causal-CoT用于推断因果关系。实验表明,NTS-CoT在减轻这些问题和提高时间线摘要性能方面优于现有方法。

  10. RESEARCH · CL_82086 ·

    新方法恢复LLM微调过程中丢失的长上下文记忆

    研究人员发现,思维链(CoT)微调虽然提高了推理能力,但会显著降低混合线性注意力模型中的长上下文记忆。这个问题被称为“注意力遗忘”,会导致在“海量信息找针”(Needle-In-A-Haystack)等任务上的性能下降。一种名为QK-Restore的无训练新方法被提出,通过恢复微调前检查点的特定查询-键投影权重来解决此问题,成功恢复了长上下文能力,而没有牺牲推理性能。

  11. TOOL · CL_51144 ·

    大型语言模型通过新的先验证提示策略提高推理能力

    研究人员开发了一种名为“先验证”(Verification-First, VF)的新提示策略,可以在没有显著训练成本或大量采样的情况下提高大型语言模型的推理能力。该方法提示大型语言模型在生成最终解决方案之前先验证一个候选答案,即使是随机答案。VF通过启动一个“逆向推理”过程来有效地修剪模型的输出分布,该过程是对标准的正向思维链(Chain-of-Thought)提示的补充。实验表明,VF在开销极小的情况下始终优于标准的思维链提示,而迭…

  12. RESEARCH · CL_50618 ·

    新数据集通过逐级推理增强LLM张量程序优化能力

    研究人员推出Step-TP,一个旨在提升大型语言模型(LLMs)优化张量程序能力的新数据集。现有方法通常缺乏逐级监督和可解释性,阻碍了LLMs在复杂优化任务上的表现。Step-TP提供了原子级的、逐级监督以及结构化的链式思考推理,使LLMs能够通过理解中间程序状态来做出更可靠的单步决策。

  13. RESEARCH · CL_48719 ·

    大语言模型研究探索句法编码与推理效率

    两篇新研究论文探讨了大语言模型(LLMs)的内部工作机制及其推理能力。一篇论文调查LLMs是否编码了超出标准语言标注所能捕捉到的形式句法结构,并发现了支持这一观点的证据。另一篇论文提出了一种新方法EDRM,通过分析文本生成过程中的熵动力学来确定何时LLMs能从思维链(chain-of-thought)推理中受益,表明选择性推理可以提高效率和准确性。

  14. RESEARCH · CL_48717 ·

    小型LLM使用位置复制捷径进行算术,绕过CoT逻辑

    一篇新的研究论文揭示了小型语言模型在使用链式思考(CoT)提示执行算术任务时存在一个重要的捷径。这些模型倾向于复制答案分隔符之前的位置数字,而不是依赖逻辑排序,即使中间的推理步骤不正确或被打乱,这种位置复制也能解释其准确性的很大一部分,这突显了评估CoT忠实度时潜在的故障模式。