研究人员开发了ScienceArena,这是一个旨在评估大型语言模型(LLMs)科学推理能力的新基准。该基准借鉴了最近的物理、化学和生物学竞赛,包括国际物理奥林匹克竞赛和国际化学奥林匹克竞赛。ScienceArena采用过程信用评分系统,并由专家和奥林匹克奖牌获得者进行数字化和验证,以确保准确性。对十四个LLMs的初步评估表明,虽然顶级模型在某些考试中取得了奖牌级别的分数,但在化学和在长串解题过程中保持一致性方面仍然存在挑战。 AI
影响 该基准测试有望推动LLMs在科学推理和解决问题能力方面的改进。
排序理由 该集群包含一篇介绍用于评估LLMs的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- International Baccalaureate Organization
- International Chemistry Olympiad
- International Physics Olympiad
- LLMs
- ScienceArena
- USNCO
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →