研究人员开发了Intern-S1-MO,这是一种新颖的长时域推理代理,旨在解决奥赛级别的复杂数学问题。该代理采用多轮、分层推理方法,使用相互连接的大型推理模型(LRM)系统进行推理、摘要和验证。通过维护一个紧凑的引理记忆,Intern-S1-MO可以在多个阶段探索广泛的推理空间,克服了标准LRM的上下文长度限制。该系统使用一种新的强化学习框架OREAL-H进行训练,该框架同时增强了LRM的推理能力和代理的整体性能。实验表明,Intern-S1-MO取得了显著成果,在IMO2025非几何问题上可媲美银牌选手,并在CMO2025竞赛中达到金牌水平。 AI
影响 这项研究展示了一种新颖的AI长时域推理方法,有望在复杂问题求解领域提升能力。
排序理由 该项目是一篇研究论文,详细介绍了一种用于数学问题求解的新型AI代理和训练框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →