arXiv上的一篇新研究论文探讨了用于代码生成的大型语言模型(LLM)的过度自信问题。研究发现,不正确的代码常常以高度自信的方式生成,使得使用现有的不确定性指标难以将其与正确代码区分开来。即使是指令调优和常见的缓解策略也未能持续解决这种过度自信的失败模式,这表明模型内部的隐藏表征可能包含更可靠的正确性信号。 AI
影响 强调了LLM代码生成中的一个关键可靠性问题,表明当前方法不足以确保正确性。
排序理由 该集群包含一篇详细介绍LLM行为研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- DagsHub
- Gotit.pub
- Hugging Face
- LLM
- Ravishka Rathnasuriya
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →