Spark-X2.5,一个大型语言模型,已荣登 Hugging Face 热门模型榜单榜首。为进一步测试其能力,开发者正在启动 Spark-X2.5 数学推理挑战赛。鼓励参赛者使用各种基准和方法来评估模型的数学推理能力,提交时间为 2026 年 9 月 7 日至 9 月 13 日。 AI
影响 测试和评估 LLM 数学推理能力,可能推动专业化 AI 应用的改进。
排序理由 该条目宣布了一项评估现有模型的挑战赛,而非新发布或重大的研究发现。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →