一项新的论文探讨了使用内省不确定性估计 (IUE) 来衡量大型语言模型 (LLM) 生成代码的正确性。研究表明,LLM 隐藏状态可以在响应和代码行级别上有效指示功能代码的正确性,这对于实际软件工程至关重要。虽然静态单标记探测最有效,但在不同任务和领域上的泛化性有所下降。研究还发现,代码行级别的预测比响应级别的估计更具挑战性,尽管条件定位设置在识别故障点方面显示出有效性。 AI
影响 这项研究可以提高 LLM 生成代码在实际软件开发中的可靠性和可信度。
排序理由 学术论文,详细介绍了一种评估 LLM 代码生成的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- BigCodeBench
- CatalyzeX Code Finder for Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Introspective Uncertainty Estimation
- Large Language Models
- LiveCodeBench
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →