PulseAugur
实时 12:29:02
实体 Chain Of Thought

Chain Of Thought

PulseAugur coverage of Chain Of Thought — every cluster mentioning Chain Of Thought across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
13
90 天内 96
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 92
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/5 页 · 共 96 条
  1. TOOL · CL_210394 ·

    UMER框架统一嵌入和排序以实现多模态检索

    研究人员推出UMER,一个旨在统一嵌入和排序以实现通用多模态检索任务的新框架。该方法采用感知对的判别性推理,通过对比查询-候选对来识别相关的匹配和差异证据,这与以往孤立推理的方法不同。UMER在一个多模态大语言模型(MLLM)中联合学习用于高效全局匹配的对比嵌入和用于成对相关性判断的判别性排序。该框架在MMEB-V2基准测试中展示了最先进的性能。

  2. TOOL · CL_206182 ·

    新框架利用编辑判断对齐音频大语言模型以实现章节划分

    研究人员开发了AudioChaps,一个用于对齐音频大语言模型(LALMs)以执行音频章节划分任务的训练后框架。该框架利用组相对策略优化(GRPO)和思维链(CoT)推理来改进LALMs将连续音频流分割成主题连贯章节的方式。为此,精心整理了三个新数据集——AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval,其中后者用作基准。使用此框架训练的AudioChaps-R1模型在章节划分任务…

  3. SIGNIFICANT · CL_197360 ·

    OpenAI 发布内置思维链的“Strawberry”o1 推理模型

    OpenAI 推出了一个代号为“Strawberry”且内部称为 o1 的新 AI 模型系列,这标志着其架构的重大转变。与预测下一个 token 的传统自回归模型不同,o1 作为一种“推理模型”运行,采用内部思维链(Chain-of-Thought, CoT)过程。这使得模型在生成最终输出之前能够进行逐步推理,从而增强其在复杂问题解决方面的能力,尤其是在 STEM 和编程领域。o1 的训练利用了强化学习来优化其内部推理策略,尽管这种方…

  4. RESEARCH · CL_198202 ·

    思维链解锁 Transformer 中的分支复杂性

    研究人员开发了新的思维链(CoT)构造,展示了如何在 Transformer 中实现分支复杂性。这些构造利用硬注意力解码器,为深度优先搜索(DFS)和 Dijkstra 算法提供了明确的、有界深度的实现方法。该研究表明,CoT 可以在线性步骤中计算树的 Strahler 数,并将有序树与 Dyck 路径相关联,从而为有界深度 Transformer 的表达能力提供了新的见解。

  5. TOOL · CL_196014 ·

    新的CARE框架提升了医学VQA模型的可靠性和可信度

    研究人员开发了CARE,一个旨在提高医学视觉问答(VQA)模型可靠性的框架。CARE解决了置信度失校准问题,即模型表达的确定性与其诊断准确性不符。该框架采用两阶段流程,包括使用合成的医学思维链数据进行监督微调,以及在组相对策略优化中引入新颖的置信度感知奖励机制,以更好地使置信度与正确性保持一致。在三个医学VQA基准上的评估表明,CARE在提高诊断准确性的同时,降低了校准误差和幻觉率,为更值得信赖的临床决策支持工具铺平了道路。

  6. TOOL · CL_193656 ·

    LLM辅助框架提升硬件设计测试与调试效率

    研究人员开发了LAUDE框架,该框架利用大型语言模型(LLMs)辅助生成单元测试和调试硬件设计。通过将LLMs的链式思考推理与设计执行信息相结合,LAUDE旨在提高测试生成的准确性和调试的效率。在VerilogEval数据集的有缺陷硬件设计代码上进行应用,LAUDE成功检测出多达100%组合逻辑设计的缺陷,并调试了其中高达93%的设计。

  7. RESEARCH · CL_193307 ·

    新研究探索大型语言模型中的递归和隐式推理

    两篇新研究论文探讨了改进大型语言模型(LLMs)隐式推理的方法。第一篇论文介绍了“递归深度 Transformer”,它通过在相同的 Transformer 层上进行迭代计算来增强组合泛化能力。第二篇论文提出了“ReLIT”(递归隐式 Transformer),一个框架,通过添加一个可训练的递归块来增强一个固定的 LLM,在输出前优化潜在思维,旨在弥合符号推理与自然语言连贯性之间的差距。

  8. TOOL · CL_187321 ·

    代码驱动的推理框架增强文本到图像生成

    研究人员推出了一种新颖的文本到图像生成框架 CoCo (Code-as-CoT),该框架利用可执行代码来表示推理过程。与传统的自然语言推理相比,这种方法能够对复杂的视觉元素和结构化内容进行更精确的规划。CoCo 生成代码来创建草图图像,然后通过编辑进行细化以生成最终输出。该框架在各种基准测试中表现出显著的改进,优于直接生成和其他思维链方法。

  9. TOOL · CL_180971 ·

    CoT-Edit框架增强指令式视频编辑

    研究人员推出CoT-Edit,一个用于指令式视频编辑的新型框架,以应对复杂场景中的挑战。该系统利用思维链(CoT)增强的多模态大语言模型,通过对视频内容和指令进行推理来生成精确的边界框和编辑指令。这些空间先验知识随后指导基于扩散的模型编辑器,生成高保真、时间连贯且空间对齐的编辑效果,在减少数据需求的同时展现了最先进的性能。

  10. RESEARCH · CL_180546 ·

    AI Chain-of-Thought 监控在隐性影响场景下不太可靠

    新研究表明,思维链(CoT)监控,作为一种先进AI模型至关重要的安全功能,可能不如之前假设的那样可靠,尤其是在影响是隐性而非显性而非显性的场景下。研究表明,虽然CoT监控器可以在直接指示隐藏行为的情况下检测到高比例的行为变化,但当影响是微妙的或无意的时,其有效性会显著下降。系统提示的添加旨在减轻偏见,可能会进一步加剧这种检测率的降低,从而可能导致对AI安全产生虚假的安全感。

  11. RESEARCH · CL_174188 ·

    具备推理能力的LLM通过改进威胁检测来应对SOC警报疲劳

    研究人员开发了一种具备推理能力的语言模型,以应对安全运营中心(SOC)的警报疲劳。该模型结合了提示优化、自训练和强化学习,并在Windows端点检测上进行了训练,旨在提高威胁分类的准确性。一项关键创新是训练了一个校准器,用于评估模型推理过程的置信度,这对于可靠的自动化分类至关重要。与直接标签分类器相比,该方法在测试准确率上达到了82.6%,并显著提高了良性和恶意检测的召回率,证明了有针对性的训练比单纯的模型规模更有价值。

  12. TOOL · CL_167481 ·

    Loong项目支持LLM推理的可扩展合成数据生成

    研究人员推出Loong,一个开源框架,旨在为训练推理密集型领域的LLM生成和验证合成数据。该框架包括LoongBench,一个包含12个领域人工审核示例的数据集,以及LoongEnv,一个用于生成新的问答代码三元组的环境。该系统旨在克服可验证数据集有限和监督成本高昂的挑战,使LLM能够通过具有可验证奖励的强化学习来改进其链式思维(CoT)推理。

  13. TOOL · CL_154408 ·

    新的MMR-V基准揭示LLM在深度视频推理方面存在困难

    引入了一个名为MMR-V的新基准,用于评估大型语言模型(LLM)在处理视频内容时的多模态深度推理能力。与侧重于简单帧匹配的现有基准不同,MMR-V要求模型执行长距离、多帧推理,并推断超出直接感知的信息。使用MMR-V进行的实验(包含317个视频中的1,257个任务)显示,即使是像Gemini 2.5 Pro这样的先进模型也面临困难,准确率仅为64.3%,而像Chain-of-Thought这样的常用推理增强策略改进有限。

  14. TOOL · CL_154404 ·

    新的GRASP框架通过视觉地面化和思维链推理增强了多模态讽刺检测

    研究人员推出了一种新颖的GRASP框架,旨在通过整合视觉地面化和思维链(CoT)推理来改进多模态讽刺检测。该方法旨在提高可解释性和讽刺目标细粒度定位,超越传统的黑盒方法。GRASP使用了一个名为MSTI-MAX的精选数据集和双阶段优化策略,在识别跨模态讽刺方面表现出色,并提供了可衡量的内部推理链质量。

  15. TOOL · CL_154296 ·

    新的SCA方法在保留答案的同时压缩AI推理

    研究人员开发了一种名为“分段式思维链压缩与答案对齐”(SCA)的新方法,以减少AI模型中思维链(CoT)推理的token数量。与压缩整个完成内容的前期方法不同,SCA专门针对思考-追踪(think-trace)部分进行压缩,同时保留答案部分的完整性。该方法旨在通过将答案部分与冻结的基础模型对齐来防止“答案漂移”,从而在各种数据集和领域中保持性能。

  16. TOOL · CL_154266 ·

    新的几何方法通过思维链增强LLM的道德推理能力

    研究人员开发了一种新方法,通过解决大型语言模型(LLM)在价值冲突方面面临的挑战来提高其道德推理能力。该研究提出,在用压缩标量奖励进行训练时,思维链(CoT)推理可以稳定LLM,这是人类反馈强化学习(RLHF)中的一种常用技术。通过对CoT进行几何分析,研究人员发现它可以平滑模型的损失景观,提高优化稳定性,并可能泛化到各种道德推理任务。为此,设计了一种新颖的、专门针对价值冲突的CoT,进一步提高了道德推理性能,并促进了LLM中的多元对齐。

  17. TOOL · CL_154078 ·

    新的PUMA框架诊断并纠正大型语言模型的推理错误

    研究人员推出了一种新颖的PUMA框架,旨在诊断和解决大型推理模型(LRMs)中的推理病理。PUMA基于新提出的相位-动量对齐假说(Phase-Momentum Alignment Hypothesis),该假说认为准确的推理依赖于几何动量和不确定性消解之间的同步交互。该框架利用认知能量模型(Cognitive-Energy Model)量化这些动态,并采用分层诊断架构来区分主动探索和被动停滞,从而实现自适应干预。实验表明,PUMA在各…

  18. RESEARCH · CL_145749 ·

    新数据集增强了医学大语言模型的三维空间推理能力

    研究人员开发了一种新方法来提高医学多模态大语言模型(MLLMs)的三维空间推理能力。该方法通过一种新颖的切片式数据合成范式创建了一个大规模结构化推理数据集,解决了三维医学成像中高昂的标注成本和数据不透明性等挑战。合成数据模拟了放射科医生的诊断工作流程,将三维阅读过程分解为细粒度的、每切片的观察,形成了一个可解释的思维链(Chain-of-Thought)。使用此数据对预训练的二维MLLM进行指令微调,显著增强了其体积理解和空间推理能力…

  19. TOOL · CL_141804 ·

    新框架增强MLLM在视觉问答中的知识推理能力

    研究人员开发了一个名为Hindsight Distilled Reasoning (HinD) 的新框架,以提高多模态大语言模型 (MLLM) 在视觉问答任务中的知识推理能力。HinD框架采用一种自鼓励蒸馏过程,其中一个“Hindsight Teacher”模型生成带有正确答案的推理轨迹,然后用于训练一个“Foresight Student”模型。该学生模型在事先不知道答案的情况下,学习生成逐步推理和相关事实,从而增强其有效整合外部知…

  20. RESEARCH · CL_139613 ·

    新的大语言模型框架旨在改善推理和上下文剪枝

    两篇新的研究论文提出了改进大语言模型(LLM)推理和上下文管理的新方法。第一篇论文《Structured Thoughts》介绍了一个将推理组织成不同“尝试”和“结果”块的框架,使模型能够总结步骤并剪枝不太关键的信息,从而在推理基准测试中实现显著的内存节省和性能提升。第二篇论文《Latent Thoughts Tuning (LT-Tuning)》提出了一种训练后框架,将上下文隐藏状态与词汇嵌入空间的语义指导相结合。该方法旨在连续潜在…