研究人员推出了MathNet,这是一个新的多模态、多语言数据集,旨在评估大型语言模型的数学推理和检索能力。该数据集包含来自47个国家和17种语言的30,000多个奥林匹克级别数学问题,跨越二十年。初步实验表明,像Gemini-3.1 Pro和GPT-5这样的当前最先进模型在这些复杂问题上仍然面临挑战,而像DeepSeek-V3.2-Speciale这样的检索增强生成模型则表现出显著的性能提升。 AI
影响 该基准有望推动AI在数学推理和检索能力方面的改进,尤其是在多语言环境中。
排序理由 该集群描述了一篇介绍AI研究基准数据集的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →