train of thought
PulseAugur coverage of train of thought — every cluster mentioning train of thought across labs, papers, and developer communities, ranked by signal.
- instance of CatalyzeX 90%
- instance of Chain Of Thought 90%
- instance of Tree of Thoughts: Deliberate Problem Solving with Large Language Models 90%
- used by alphaXiv 70%
- used by Gotit.pub 70%
- used by Chain Of Thought 70%
- authored by alphaXiv 70%
- instance of alphaXiv 70%
- used by CatalyzeX 70%
- authored Gotit.pub 70%
- used by supervised fine-tuning 70%
- instance of Gotit.pub 70%
24 天有情绪数据
-
Chain of Thought 提示工程可增强 LLM 的推理和透明度
Chain of Thought (CoT) 提示工程是一种通过将复杂问题分解为中间推理步骤来指导大型语言模型 (LLM) 的技术。该方法通过提高透明度、改进准确性和减少幻觉来增强 LLM 的能力。通过向模型展示如何逐步得出解决方案,CoT 使 AI 的决策过程更加可见和可靠,尤其适用于需要多步推理的任务。
-
探索用于边缘 LLM 的可逆思维链推理
一位 Reddit 用户提出了一个关于大型语言模型(LLM)思维链(CoT)推理的新颖方法,旨在减少信息丢失和内存使用。核心思想是使每个推理步骤近似可逆,其灵感来自 Toffoli 和 Fredkin 等经典可逆计算门。这种可逆性可以通过循环一致性实现即时健全性检查,通过高效地取消计算中间标记以减少内存占用,以及在推理路径遇到死胡同时进行更便宜的回溯。所提出的方法可能涉及轻量级适配器或结构化潜在寄存器,而不是尝试逆转原生的 Trans…
-
新研究通过新颖的游戏结构评估大型语言模型的战略推理能力
一篇新研究论文介绍了一种评估大型语言模型(LLMs)战略推理能力的新颖方法。所提出的“K-级可区分性”条件旨在通过使用特殊构造的游戏结构来区分真正的战略深度和单纯的记忆。对四种大型语言模型在各种游戏类型和推理级别进行的实验表明,模型可以在递归推理下保持准确的战略深度,但其在从对手博弈中进行归纳推理时性能会显著下降。链式思考中的显式战略推理被发现能显著提高整体性能。
-
思维链提示在翻译系统中显示出有限的语音感知能力
一篇新发表在arXiv上的研究论文探讨了思维链(CoT)提示在语音到文本翻译(S2TT)系统中的有效性。研究发现,当与级联的自动语音识别(ASR)和文本到文本翻译(T2TT)模块一起使用时,CoT主要依赖转录的文本,并且很少利用实际的语音线索。研究人员建议需要进行架构更改,以更好地整合声学信息,从而提高S2TT的性能。
-
作者测试LLM思维链的忠实度,发现计算和解释是可分离的
作者详细介绍了旨在测试LLM中思维链(CoT)推理忠实度的三个模型的实验。核心问题在于生成的推理是否直接导致答案,还是事后合理化。通过早期回答和错误注入等干预措施,作者发现忠实度和准确性提升不一定挂钩。第三个模型v3成功证明,即使文本追踪不忠实,计算也能辅助答案,从而将计算的好处与监督所需的可验证解释分离开来。
-
新的AI方法增强图表理解和编辑能力
研究人员开发了新的方法来改进多模态大型语言模型(MLLMs)理解和交互图表的方式。一种方法CharTool集成了外部工具进行视觉感知和基于代码的计算,增强了数值推理和接地能力。另一种方法REChart通过优化中间推理步骤和减轻模型的“过度思考”来专注于高效的图表编辑。这两种方法在图表相关基准测试中都显示出显著的改进,优于现有基线,并取得了与更大模型相媲美的结果。
-
AI框架利用大型语言模型和强化学习优化无人机物流
研究人员开发了一个自主AI框架,用于优化云制造环境中无人机(UAV)的物流调度。该框架集成了大型语言模型和思维链推理,将用户输入转化为复杂问题的数学公式,该问题将物理产品收集与计算任务调度相结合。采用一种分层深度强化学习方法,特别是近端策略优化(PPO),来管理无人机路线规划和任务执行,在模拟中展示了99.6%的产品收集率和100%的截止日期满意度。
-
新的 CHIVE 系统通过反事实实验评估 LLM 解释
研究人员开发了 CHIVE,一个新颖的代理式管道,旨在通过反事实提示编辑来识别和调查大型语言模型 (LLM) 的意外行为。该系统生成数千种自然发生的模型行为的解释,并辅以反事实证据。初步实验显示,常见的 LLM 可解释性技术并未提高代理预测反事实模型行为的能力。然而,在 CHIVE 生成的反事实实验数据上训练模型,证明了其在各种分布外设置中的泛化能力,这表明了一种改进 LLM 解释能力的新方法。
-
新的LLM-Agent框架增强了无人机导航
研究人员开发了一个名为LAPF(基于LLM的Agent路径查找器)的新框架,用于在复杂的户外环境中使用无人机(UAV)进行自主导航。该框架集成了感知、记忆、规划和行动模块,并利用大型语言模型(LLM)进行推理和决策。在试验中,LAPF与传统方法相比,在路径效率和危险响应方面表现出改进,路径长度显著缩短,对障碍物的处理更加稳定。
-
新研究使用CoT和DPO解决LLM中的政治偏见
一篇新研究论文提出在大型语言模型(LLMs)推理过程中缓解对抗性政治偏见的方法。该研究引入了使用思维链(CoT)提示和直接偏好优化(DPO)的策略,以保护LLM免受有偏内容注入。使用立法视频摘要进行的实验表明,递归自我纠正方法在政治中立性量表上显著提高了模型性能,将其从基线2.14提高到4.56。
-
LLM文本到SQL基准按自主性轴分析 · 跟踪到1个来源
一篇新论文重新审视了LLM文本到SQL领域,提出了一种基于自主性的分类法和经验基准分析。作者收集了报告的指标,并沿着推理自主性轴进行组织,涵盖了受限、上下文内、迭代、Agentic和推理内化生成。他们对Spider基准进行的案例研究比较了各种开源模型(有无思维链监督)与既有基线,结果表明自主性增加是有代价的,并且思维链监督主要使更复杂的查询受益。
-
TAMP-Nav 框架增强大型视觉语言模型(VLMs)的具身导航能力
研究人员推出 TAMP-Nav,一个旨在增强大型视觉语言模型(VLMs)具身导航能力的新框架。该方法将导航任务重新构建为二维视觉提示,使 VLMs 能够选择像素,然后将这些像素投影到三维坐标以执行。TAMP-Nav 还包含一个选择性推理机制,仅在关键节点触发思维链(Chain-of-Thought),并使用锚点轨迹记忆(Anchor-Trajectory Memory)来压缩冗余路径。该框架在 R2R-CE 等基准测试中取得了最先进的…
-
LLM 的有效提示工程技术
提示工程通常被认为不可靠,但通过关注基于大型语言模型(LLM)工作原理的具体技术,可以使其变得有效。关键策略包括:明确指定期望的输出格式、提供少量示例以展示模式,以及采用思维链提示以鼓励复杂任务的逐步推理。此外,为 LLM 分配一个有目的的角色并将其分解为更小的、顺序性的提示可以显著提高性能,而礼貌、模糊的最高级和提示填充通常是无效的。
-
Chain-of-Symbol 提示在 LLM 推理方面比基于散文的方法更稳健
Hu 等人的一篇论文详细介绍了 Chain-of-Symbol (CoS) 提示,它提供了一种比传统的 Chain-of-Thought (CoT) 更稳健的 LLM 推理方法。CoT 依赖散文作为中间步骤,这可能导致错误和状态损坏,而 CoS 使用符号表示。这种符号状态以及定义的符号表确保了对信息的单一、无歧义的读取,从而防止了基于散文的推理中常见的边或方向丢失。与每次重新渲染状态时都可能变化的 CoT 不同,符号方法还允许机器可解…
-
新框架ForgeryVCR改进了多模态大语言模型在图像伪造检测方面的能力
研究人员推出ForgeryVCR,一个旨在提高多模态大语言模型(MLLMs)在检测和定位图像伪造方面的准确性的新框架。与以往以文本为中心的方法(由于语言模态在捕捉细微像素不一致性方面的局限性而常常导致幻觉)不同,ForgeryVCR集成了高效的取证工具箱。该工具箱将不可察觉的痕迹物化为显式的视觉中间体,实现了视觉中心推理。该框架采用战略工具学习范式,结合监督微调和强化学习,使MLLMs能够主动调用多视图推理路径进行详细检查。
-
研究发现,相似性信号可诱导大型语言模型(LLM)合作
一篇新的研究论文探讨了大型语言模型(LLM)在战略场景中的互动方式,特别关注囚徒困境。该研究引入了一个框架来评估在提供相似性信号时LLM的决策,发现不同的LLM模型表现出不同的反应。令人惊讶的是,用于相似性计算的数据集对诱导合作的影响很小,并且在评估彼此的推理过程时,LLM倾向于自我识别为相似。
-
思维链解锁 Transformer 中的分支复杂性
研究人员开发了新的思维链(CoT)构造,展示了如何在 Transformer 中实现分支复杂性。这些构造利用硬注意力解码器,为深度优先搜索(DFS)和 Dijkstra 算法提供了明确的、有界深度的实现方法。该研究表明,CoT 可以在线性步骤中计算树的 Strahler 数,并将有序树与 Dyck 路径相关联,从而为有界深度 Transformer 的表达能力提供了新的见解。
-
新的大型语言模型框架通过频谱动力学和推理增强时间序列预测
两篇新的研究论文提出了将大型语言模型(LLM)适配时间序列预测的新颖框架。第一个框架FM-LLM利用增强频率的专家混合方法,并结合傅里叶分析网络注入频谱动力学,在多个基准测试中取得了最先进的性能。第二个框架REATS采用LLM推理进行自适应集成学习,使用思维链生成可解释的、样本特定的集成权重,并优于竞争性基线。
-
新框架提升视觉语言模型空间推理能力,一模型表现优于GPT-4o
研究人员开发了新的方法来提高视觉语言模型(VLMs)的空间推理能力。SCOUT框架使用结构化思维链(CoT)和多目标强化学习来增强3D环境感知和推理,其中SCOUT-7B在某些任务上的表现优于GPT-4o。另一种方法是优势引导门控(Advantage-Guided Gate),它通过使用蒙特卡洛价值评估并选择高价值的推理步骤和轨迹,动态纠正开放式推理过程中的偏差。这两种方法都旨在创建更强大、更准确的用于空间智能的VLMs。
-
新框架通过在线思维链验证增强LLM的可靠性
研究人员开发了一个新的在线学习思维链验证器框架,旨在提高大型语言模型(LLMs)的可靠性。该方法解决了当验证器指导LLM生成时发生的分布偏移挑战。该研究引入了Littlestone维度的 novel 扩展来表征错误界限,并提供了最小化不对称成本的最优算法。学习到的验证器可以提高多个弱生成器的准确性,并使它们能够产生超出其初始训练范围的输出。