PulseAugur
实时 10:02:57
English(EN) Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

新的评分方法使用 LLM 置信度对科学假设进行排名

研究人员开发了一种名为基于 Logit 的能量评分的新方法来评估大型语言模型(LLM)生成的科学假设。该方法利用 LLM 对假设的内在置信度,而不是依赖可能偏向传统观点的比较判断或语义相似性。在涉及 12 个学科的 1,323 篇论文的基准测试中,这种内在评分方法达到了 33.0% 的 Hit@1 率,显著优于传统的 LLM 作为裁判的方法。最有效的配置,使用一个 10 亿参数的模型,准确率达到了 53.1%,表明在更值得信赖的 AI 辅助科学发现方面具有巨大潜力。 AI

影响 这种新的评分方法可以通过更好地识别新颖且有效的假设来提高 AI 在科学发现中的可靠性。

排序理由 学术论文,详细介绍了一种评估 LLM 生成的科学假设的新方法。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的评分方法使用 LLM 置信度对科学假设进行排名

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Swati Rajwal, Sanjay Das, Tirthankar Ghosal ·

    大型语言模型能识别出好的假设吗?基于logit的能量评分在科学假设排序方面优于提示式的大型语言模型作为裁判

    arXiv:2608.17270v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used for scientific hypothesis generation. However, evaluating generated hypotheses remains a challenge for trustworthy AI-enabled scientific workflows. Existing approaches often use LLM…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    大型语言模型能识别出好的假设吗?基于logit的能量评分在科学假设排名方面优于提示式的大型语言模型作为评判者

    Large language models (LLMs) are increasingly used for scientific hypothesis generation. However, evaluating generated hypotheses remains a challenge for trustworthy AI-enabled scientific workflows. Existing approaches often use LLMs as judges or rely on semantic similarity, whic…