研究人员开发了NovGauge,一个旨在微调和诊断大型语言模型(LLM)在评估研究论文新颖性方面能力的新基准。该基准包含619对论文和50组多篇论文,从任务、问题和方法三个维度评估新颖性。对18个LLM的初步评估显示,幻觉率和证据忠实度存在显著问题,即使是表现最好的模型GPT-5.5,在验证后也难以保持准确性。 AI
影响 凸显了当前LLM在科学文献分析中的局限性,表明需要进一步发展其推理和证据基础能力。
排序理由 该项目描述了一个用于评估LLM的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- GPT-5.5
- Hugging Face
- International Conference on Learning Representations
- Litmaps
- NovGauge
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →