PulseAugur
中
实时 01:27:19
English(EN) PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

新的PhysElite基准揭示多模态大型语言模型在奥赛级物理方面存在困难

研究人员推出了PhysElite,这是一个旨在评估多模态大型语言模型(MLLMs)物理问题解决能力的新基准。该基准包含11,586个奥赛级物理问题,配有视觉图表、中文和英文的逐步解决方案以及最终答案。对18种不同MLLMs的初步测试显示,即使是表现最好的模型准确率也仅为33.7%,这凸显了当前人工智能模型在专家级物理推理方面仍有很大的改进空间。评估还包括了步骤级分析,以 pinpoint 模型在推理链中具体薄弱的环节。 AI

影响 强调了当前MLLMs在复杂推理任务中的局限性,表明人工智能的科学问题解决能力需要进步。

排序理由 该集群描述了一篇介绍用于评估AI模型基准数据集的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的PhysElite基准揭示多模态大型语言模型在奥赛级物理方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang ·

    PhysElite:大型语言模型距离解决奥赛级物理问题还有多远?

    arXiv:2608.25097v2 Announce Type: replace Abstract: Understanding how (multimodal) large language models perform on physics problems requires benchmarks that reflect the difficulty and breadth of expert-level physical reasoning. Existing physics benchmarks remain limited in the f…