一项新论文揭示了学术研究中评估的AI模型能力与当时实际可用的前沿模型之间存在显著差距。研究发现,中位数研究论文评估的模型比当前最先进的模型落后约10.85 ECI点,且这一差距每年都在扩大。这种“发表诱导差距”归因于同行评审延迟之外的因素,其中很大一部分源于使用了较旧或能力较弱的模型以及评估配置披露不足。 AI
影响 凸显了AI评估中的系统性问题,可能通过夸大当前能力而误导政策和投资。
排序理由 这是一篇分析AI模型学术评估的研究论文。
- Claude Opus 4.5
- Claude Opus 4.7
- Claude Sonnet 3.7
- Epoch AI Capabilities Index
- GPT-4o-mini
- GPT-5.5 Pro
- VERSIO-AI
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →