研究人员推出了PhysElite,这是一个旨在评估多模态大型语言模型(MLLMs)物理问题解决能力的新基准。该基准包含11,586个奥赛级物理问题,配有视觉图表、中文和英文的逐步解决方案以及最终答案。对18种不同MLLMs的初步测试显示,即使是表现最好的模型准确率也仅为33.7%,这凸显了当前人工智能模型在专家级物理推理方面仍有很大的改进空间。评估还包括了步骤级分析,以 pinpoint 模型在推理链中具体薄弱的环节。 AI
影响 强调了当前MLLMs在复杂推理任务中的局限性,表明人工智能的科学问题解决能力需要进步。
排序理由 该集群描述了一篇介绍用于评估AI模型基准数据集的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- DagsHub
- Gotit.pub
- Hugging Face
- MLLMs
- Olympiad-level physics problems
- PhysElite
- Ruoran Xu
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →