一篇新研究论文发布在arXiv上,探讨了大型语言模型(LLMs)中随机采样的局限性。该研究题为“随机采样在认知上是肤浅的:LLM中温度变化与模型多样性之间的维度鸿沟”,表明单一代言模型多次运行产生的输出变化并不能有效地揭示模型不知道的内容。研究人员使用MMLU、HellaSwag和GSM8K等基准测试,将单一代言模型运行100次与24个LLM模型的一次运行集合进行了比较。他们的发现表明,虽然自我一致性提供了每个问题的模型不确定性,但它缺乏跨问题结构洞察,而这只有通过多样化的模型集合才能显现出来。 AI
影响 这项研究表明,依赖单一模型输出变化来估计不确定性可能不足够,突显了模型集合在更全面地理解LLM知识差距方面的价值。
排序理由 研究论文发布在arXiv上,详细介绍了关于LLM采样的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- GSM8K
- HellaSwag
- Hugging Face
- Marchenko--Pastur
- Massive Multitask Language Understanding
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →