Self-Consistency In Llms
PulseAugur coverage of Self-Consistency In Llms — every cluster mentioning Self-Consistency In Llms across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
拥有更好工具的单一 AI 智能体通常优于多智能体系统
最近的一项分析表明,许多多智能体 AI 系统过于复杂,可以将其设计为拥有改进工具的单一智能体以提高效率。将多智能体系统与拥有同等计算资源的单一智能体进行比较的研究通常显示,多智能体方法表现不佳且成本更高。文章认为,管理多个智能体的复杂性,包括重复的上下文和交接过程中的信息丢失,在大多数情况下会超过其带来的好处。它提出了一个测试:如果无法独立评估单个智能体,那么它可能就不需要成为一个独立的智能体。
-
新AI方法通过自蒸馏和自一致性提升视频推理能力
两篇新研究论文探讨了增强AI模型视频推理能力的新颖方法。第一篇论文介绍了帧差分策略内自蒸馏(FD-OPSD)技术,该技术在强化学习训练过程中将密集帧观测的证据转移到稀疏帧策略上,从而提高了Qwen2.5-VL-7B和Qwen3-VL-4B等模型在视频推理基准上的性能。第二篇论文研究了基于扩散的视频推理的自一致性,提出了一种无需训练的方法,通过聚合多个视频生成的预测来实现视觉搜索和迷宫解决等任务的更高准确性,并引入了拒绝微调(RFT)将…
-
研究发现:AI顾问小组,顾问越多,分歧越明显
一篇新论文探讨了将Condorcet jury theorem应用于多个AI顾问的含义。研究强调了一个“潜在维度”,即增加AI顾问的数量在提高可靠性的同时,也使得分歧更加明显。随着顾问数量的增加,这种可见的分歧几乎不可避免,并且可能比可靠性更快地接近确定性,从而可能导致正确的多数意见显得分裂。研究结果表明,关于咨询多少顾问以及如何呈现和解释其判决的决定至关重要。
-
研究:对于 Text-to-SQL 任务,更大的模型优于增加的推理计算量
一篇新的研究论文探讨了在语法受限的 Text-to-SQL 任务中,模型大小与推理计算量之间的权衡。研究发现,即使使用 Beam Search 或 Sample+Vote 等技术,增加模型大小通常比增加推理计算量能带来更高的准确性。具体而言,在可比的推理预算下,Beam Search 比 Sample+Vote 更有效,这一发现与之前关于无约束任务的研究结果不同。
-
功率采样悖论:推理技术降低大型语言模型答案质量
研究人员发现功率采样(一种用于改进语言模型推理的技术)存在悖论。虽然它可以将概率质量集中到正确答案上,但它却会适得其反地导致整体推理性能下降,在推理基准测试中观察到的准确率下降高达 18.5 个百分点。该问题源于“剂量不匹配”,即固定的指数导致不同问题出现不同的分布变化;以及“覆盖不匹配”,即全局锐化将焦点集中在主导路径上,可能丢失广泛的推理支持。提出的解决方案是采用一种变形可控、保留支持的功率目标,该目标可以校准锐化并限制对中等概率…
-
LLM 研究表明输入多样性比输出多样性更能提高准确性
一篇新的研究论文探讨了大型语言模型 (LLM) 的测试时增强 (TTA) 方法,提出通过多样化输入数据来提高准确性比多样化输出推理路径更具计算效率。研究发现,在各种任务中,语义改写(一种 TTA 的形式)在每美元准确性方面比标准的自洽性方法优越约 1.8 倍。这种方法对于无法获得更强大模型或成本效益不高的中等模型尤其有效。
-
GradCuit 在不改变权重的情况下增强 LLM 的测试时推理能力
研究人员开发了 GradCuit,一种在不改变模型权重的情况下增强 LLM 测试时推理能力的新颖方法。该技术涉及将可优化潜向量插入到 Transformer 的中间层,使梯度能够直接流向这些向量。这种方法绕过了 token 解码的不可微分特性,实现了更稳定有效的信用分配。GradCuit 在多个模型和基准测试中的平均准确率为 64.5%,优于 Chain-of-Thought 和 LatentSeek 等现有方法。
-
新的CALM框架训练LLM以适应各种推理控制器
研究人员开发了CALM,一个旨在提高大型语言模型(LLM)对各种推理时控制器适应性的训练后框架。与之前为单一交互模式进行优化的方法不同,CALM将控制器直接集成到训练循环中。这种多任务强化学习方法通过在控制器诱导的交互协议上进行训练,使LLM能够更好地泛化到各种工作流程,包括思维链(Chain-of-Thought)、自洽性(self-consistency)和验证流程(verification pipelines)。
-
新框架GRAPHEVAL量化LLM推理的不确定性和连贯性
研究人员开发了GRAPHEVAL,一个新颖的基于图的框架,用于评估大型语言模型(LLM)的推理能力。该框架引入了图推理连贯性得分(GRCS)来量化LLM推理过程的语义和结构一致性,旨在检测诸如自信幻觉之类的问题。该研究还提出了图自洽性(GSC),这是一种解码策略,它优先考虑推理保真度而非原始准确性,特别是对于较小的模型,同时在能力更强的模型上保持或提高性能。
-
生成式模型模拟态度改变理论
研究人员开发了一种新的工作流程,使用生成式模型创建可执行的态度改变理论模拟。该方法将认知失调、自我一致性和自我感知等理论渲染为Concordia库中的参与者-环境模拟。这些实现成功复制了经典心理学实验的行为模式,但要获得稳定的结果,需要解决口头描述中的不确定性和历史实验假设问题。迭代模型稳定过程突显了原始理论中未完全记录的操作和社会生态依赖性。
-
新的SEVRA方法优化LLM推理,以提高准确性和效率
研究人员开发了一种名为选择性验证分配推理(SEVRA)的新方法,以优化大型语言模型(LLM)中的推理使用。SEVRA充当服务层控制器,决定是接受模型的初始答案还是进行额外的验证。当在MATH500数据集上使用冻结的Qwen3-4B模型进行测试时,SEVRA在显著减少令牌使用量和有害答案翻转的同时,实现了比总是验证更高的准确性。然而,该研究还发现,增加初始推理预算有时可以比选择性恢复用更少的令牌获得相似或更好的结果,这表明在采用选择性验…
-
新的CGES方法将LLM调用次数减少58%,同时保持准确性
研究人员开发了一个新的贝叶斯框架,称为置信度引导的提前停止(CGES),以提高大型语言模型(LLM)查询的效率。与需要固定调用次数的传统自洽性方法不同,CGES在单个答案获得足够置信度后即可自适应地停止采样。这种方法显著减少了所需的LLM调用次数,在五个推理基准测试中平均减少了58%,同时保持了与标准自洽性策略相当的准确性。
-
自我一致性技术对现代大型语言模型显示出收益递减
一项新研究表明,自我一致性技术(通过生成多个推理路径来提高大型语言模型的准确性)的有效性正在降低,成本也在增加。研究人员发现,在 HotpotQA 和 MATH-500 等基准测试中,增加样本数量只能带来微小的准确性提升,而标记成本却呈线性增长。在某些情况下,样本越多,性能甚至会下降,这表明对于更现代、能力更强的模型来说,自我一致性可能引入的是噪声而非信号。
-
大型语言模型通过新技术解决模型崩溃、偏见和推理成本问题
开源大型语言模型工具包 LLM 0.32a1 的新版本已发布,修复了存储在 SQLite 中的工具调用对话中的错误,提高了 AI 代理的可靠性。此外,关于大型语言模型自适应思维的研究表明,通过动态分配推理资源,自洽性可以将推理成本降低 40%。另外,与康奈尔大学合作开发的一种名为直接引导优化 (Direct Steering Optimization) 的新方法,可在不影响性能的情况下将视觉语言模型中的人口统计偏见有效降低高达 62%。
-
通过口头批评进行过程监督可提高大型语言模型的推理能力
研究人员开发了一种名为口头过程监督(VPS)的新框架,该框架无需梯度更新即可增强大型语言模型的推理能力。该方法利用更强大的AI生成的结构化自然语言批评来指导迭代的生成-批评-精炼过程。在GPQA Diamond和AIME 2025等基准测试上的实验表明,VPS取得了显著的改进,超越了现有的最先进结果,并优于Reflexion和Self-Consistency等其他方法。