PulseAugur
实时 10:31:45
English(EN) When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

研究发现:自洽性损害小型LLM在硬科学问题上的表现

一篇新的arXiv论文揭示,常见的自洽性技术(涉及对多个模型输出进行平均)实际上会降低小型大型语言模型(LLM)在挑战性科学问题上的准确性。对于Qwen2.5-7B和Llama-3-8B等模型,在思维链上进行多数投票比使用单一推理通道导致了更低的问题特定准确性。研究表明,对于这些模型在困难的科学推理任务上,置信度分数与正确性并不可靠地相关。 AI

影响 挑战了一种常见LLM推理技术的有效性,可能影响小型模型在复杂推理任务上的部署方式。

排序理由 学术论文,详细介绍了关于LLM行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:自洽性损害小型LLM在硬科学问题上的表现

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Utkarsh Bahuguna ·

    当自洽性适得其反:多数投票损害小型LLM的多数硬科学问题

    arXiv:2608.11403v1 Announce Type: new Abstract: Self-consistency (SC) via majority vote is a widely used way to spend inference-time compute: sample N chains of thought, return the plurality answer. On the full GPQA Diamond benchmark (198 graduate-level science questions), majori…