研究人员推出StochBench,这是一个旨在评估大型语言模型在随机过程复杂问题上能力的新基准。该基准包含450个研究生级别的难题,旨在比侧重于竞赛数学的现有基准更能代表领域特定的应用数学。一个使用Opus 4.8的代理在15分钟/题的时间限制内,在StochBench上达到了34.9%的证明率。 AI
影响 该基准有望推动LLM在专业数学推理和形式验证方面的能力改进。
排序理由 该条目描述了一个用于评估LLM在特定领域(随机过程)上能力的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →