一篇新的arXiv论文揭示,常见的自洽性技术(涉及对多个模型输出进行平均)实际上会降低小型大型语言模型(LLM)在挑战性科学问题上的准确性。对于Qwen2.5-7B和Llama-3-8B等模型,在思维链上进行多数投票比使用单一推理通道导致了更低的问题特定准确性。研究表明,对于这些模型在困难的科学推理任务上,置信度分数与正确性并不可靠地相关。 AI
影响 挑战了一种常见LLM推理技术的有效性,可能影响小型模型在复杂推理任务上的部署方式。
排序理由 学术论文,详细介绍了关于LLM行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →