Self Consistency In Llms
PulseAugur coverage of Self Consistency In Llms — every cluster mentioning Self Consistency In Llms across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
GradCuit 在不改变权重的情况下增强 LLM 的测试时推理能力
研究人员开发了 GradCuit,一种在不改变模型权重的情况下增强 LLM 测试时推理能力的新颖方法。该技术涉及将可优化潜向量插入到 Transformer 的中间层,使梯度能够直接流向这些向量。这种方法绕过了 token 解码的不可微分特性,实现了更稳定有效的信用分配。GradCuit 在多个模型和基准测试中的平均准确率为 64.5%,优于 Chain-of-Thought 和 LatentSeek 等现有方法。
-
新的CALM框架训练LLM以适应各种推理控制器
研究人员开发了CALM,一个旨在提高大型语言模型(LLM)对各种推理时控制器适应性的训练后框架。与之前为单一交互模式进行优化的方法不同,CALM将控制器直接集成到训练循环中。这种多任务强化学习方法通过在控制器诱导的交互协议上进行训练,使LLM能够更好地泛化到各种工作流程,包括思维链(Chain-of-Thought)、自洽性(self-consistency)和验证流程(verification pipelines)。
-
新框架GRAPHEVAL量化LLM推理的不确定性和连贯性
研究人员开发了GRAPHEVAL,一个新颖的基于图的框架,用于评估大型语言模型(LLM)的推理能力。该框架引入了图推理连贯性得分(GRCS)来量化LLM推理过程的语义和结构一致性,旨在检测诸如自信幻觉之类的问题。该研究还提出了图自洽性(GSC),这是一种解码策略,它优先考虑推理保真度而非原始准确性,特别是对于较小的模型,同时在能力更强的模型上保持或提高性能。
-
生成式模型模拟态度改变理论
研究人员开发了一种新的工作流程,使用生成式模型创建可执行的态度改变理论模拟。该方法将认知失调、自我一致性和自我感知等理论渲染为Concordia库中的参与者-环境模拟。这些实现成功复制了经典心理学实验的行为模式,但要获得稳定的结果,需要解决口头描述中的不确定性和历史实验假设问题。迭代模型稳定过程突显了原始理论中未完全记录的操作和社会生态依赖性。
-
新的SEVRA方法优化LLM推理,提高准确性和效率
研究人员开发了一种名为选择性推理分配验证(SEVRA)的新方法,以优化大型语言模型(LLM)的推理使用。SEVRA充当服务层控制器,决定是接受模型的初步答案还是进行额外的验证。在MATH500数据集上使用冻结的Qwen3-4B模型进行测试时,SEVRA在显著减少令牌使用量和有害答案翻转的同时,实现了比总是验证更高的准确性。然而,研究还发现,增加初始推理预算有时可以比选择性恢复产生更少的令牌,但结果相似或更好,这表明在采用选择性验证之前…
-
新的CGES方法将LLM调用次数减少58%,同时保持准确性
研究人员开发了一个新的贝叶斯框架,称为置信度引导的提前停止(CGES),以提高大型语言模型(LLM)查询的效率。与需要固定调用次数的传统自洽性方法不同,CGES在单个答案获得足够置信度后即可自适应地停止采样。这种方法显著减少了所需的LLM调用次数,在五个推理基准测试中平均减少了58%,同时保持了与标准自洽性策略相当的准确性。
-
自我一致性技术对现代大型语言模型显示出收益递减
一项新研究表明,自我一致性技术(通过生成多个推理路径来提高大型语言模型的准确性)的有效性正在降低,成本也在增加。研究人员发现,在 HotpotQA 和 MATH-500 等基准测试中,增加样本数量只能带来微小的准确性提升,而标记成本却呈线性增长。在某些情况下,样本越多,性能甚至会下降,这表明对于更现代、能力更强的模型来说,自我一致性可能引入的是噪声而非信号。
-
大型语言模型通过新技术解决模型崩溃、偏见和推理成本问题
开源大型语言模型工具包 LLM 0.32a1 的新版本已发布,修复了存储在 SQLite 中的工具调用对话中的错误,提高了 AI 代理的可靠性。此外,关于大型语言模型自适应思维的研究表明,通过动态分配推理资源,自洽性可以将推理成本降低 40%。另外,与康奈尔大学合作开发的一种名为直接引导优化 (Direct Steering Optimization) 的新方法,可在不影响性能的情况下将视觉语言模型中的人口统计偏见有效降低高达 62%。
-
通过口头批评进行过程监督可提高大型语言模型的推理能力
研究人员开发了一种名为口头过程监督(VPS)的新框架,该框架无需梯度更新即可增强大型语言模型的推理能力。该方法利用更强大的AI生成的结构化自然语言批评来指导迭代的生成-批评-精炼过程。在GPQA Diamond和AIME 2025等基准测试上的实验表明,VPS取得了显著的改进,超越了现有的最先进结果,并优于Reflexion和Self-Consistency等其他方法。