一项名为KINA的新基准测试被引入,用于评估大型语言模型在261个细粒度学科上的表现,解决了规模驱动设计和标注质量的问题。该基准测试包含899个项目,用于评估来自13个不同实验室的42个模型。Gemini-3.1-Pro-Preview以53.17%的得分成为表现最佳的模型,其次是Claude-Opus-4.6和GPT-5.4,这表明所有模型都有很大的改进空间。 AI
影响 为LLM建立了新的评估标准,突出了性能等级和工具增强的影响。
排序理由 该集群包含一篇介绍LLM新基准测试并报告评估结果的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →