一项于三月份发表的题为“LLM 在文档问答场景中会产生多少幻觉?一项跨越温度、上下文长度和硬件平台的 1720 亿 Token 研究”的最新研究,调查了温度设置对大型语言模型的影响。研究发现,在生产代码中常用的温度设置为 0.0 时,可能会导致不可用响应的显著增加,尤其是在长上下文长度的情况下。例如,在 128K 上下文中,Llama 3.1 8B 模型的温度设置为 0.0 时的失败率为 14.05%,而温度设置为 1.0 时仅为 2.05%。同样,在 200K 上下文中,GLM 4.7 的失败率为 2.59%,而温度设置为 1.0 时为 0.05%,这表明可靠性存在显著差异。 AI
影响 这项研究揭示了一个常见 LLM 设置中的关键缺陷,可能影响 AI 在长上下文场景中的可靠性。
排序理由 该集群关注一篇详细介绍 LLM 行为发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv:2603.08274
- GLM-4.7
- How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms
- JV Roig
- Kamiwaza AI
- llama
- Llama-3.1:8b
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →