研究人员开发了一种名为基于 Logit 的能量评分的新方法来评估大型语言模型(LLM)生成的科学假设。该方法利用 LLM 对假设的内在置信度,而不是依赖可能偏向传统观点的比较判断或语义相似性。在涉及 12 个学科的 1,323 篇论文的基准测试中,这种内在评分方法达到了 33.0% 的 Hit@1 率,显著优于传统的 LLM 作为裁判的方法。最有效的配置,使用一个 10 亿参数的模型,准确率达到了 53.1%,表明在更值得信赖的 AI 辅助科学发现方面具有巨大潜力。 AI
影响 这种新的评分方法可以通过更好地识别新颖且有效的假设来提高 AI 在科学发现中的可靠性。
排序理由 学术论文,详细介绍了一种评估 LLM 生成的科学假设的新方法。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Hugging Face
- Large language models
- Logit-Based Energy Scoring
- Prompted LLM-as-Judge
- 1-billion-parameter model
- LLM-as-a-Judge
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →