PulseAugur
实时 02:51:52
实体 International Mathematical Olympiad

International Mathematical Olympiad

PulseAugur coverage of International Mathematical Olympiad — every cluster mentioning International Mathematical Olympiad across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 9
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 15 条
  1. TOOL · CL_169497 ·

    中国AI模型Dots-Note-3.0在数学奥林匹克竞赛中获得满分

    中国AI模型dots-note-3.0在国际数学奥林匹克竞赛(IMO)中取得了满分。该模型由红笔记公司开发,成功解决了比赛中提出的所有六个复杂数学问题,比赛在上海举行。这是AI首次在享有盛誉的数学竞赛中取得如此高的成绩。

  2. TOOL · CL_164266 ·

    小红书的 dots-note 3.0 AI 在国际数学奥林匹克竞赛中获得满分

    小红书的 dots-note 3.0 AI 模型在国际数学奥林匹克竞赛中获得了满分 42 分。这是首次有 AI 系统在该竞赛的历史上获得完美分数和金牌级别的成绩。

  3. TOOL · CL_158529 ·

    新框架在 Lean 中自动化几何问题形式化

    研究人员开发了 Euclean,一个旨在 Lean 证明助手内自动化几何问题形式化的新框架。该系统通过使几何问题能够以原生的 Mathlib(Lean 的标准库)表示,解决了代数和几何推理系统之间的碎片化问题。Euclean 构建了大型数据集 OMNI-Geometry 和 Numina-Geometry,包含超过 178,000 个几何问题,这些数据集已证明能提高神经定理证明模型的性能。

  4. RESEARCH · CL_157313 ·

    中国AI模型dots-note-3.0在国际数学奥林匹克竞赛中获得满分

    中国社交媒体公司RedNote开发出首个在国际数学奥林匹克竞赛(IMO)中获得满分的AI模型。该模型名为dots-note-3.0,成功解决了全部六个复杂问题,获得满分42分。这一成就超越了此前Google DeepMind和OpenAI等机构的表现,它们去年的得分是35分。

  5. RESEARCH · CL_151621 ·

    Loopie Transformer架构在奥林匹克竞赛中取得金牌级表现

    研究人员推出了一种新颖的循环Transformer架构Loopie,旨在克服以往在扩展性方面的限制。Loopie系列包含两个混合专家(MoE)模型:一个拥有200亿参数(其中20亿为激活参数)的版本,以及一个拥有60亿参数(其中6亿为激活参数)的版本。消融研究表明,在同等计算预算下训练时,Loopie的性能显著优于传统的Transformer基线模型。此外,Loopie展现出强大的推理能力,在2025年国际数学奥林匹克竞赛和国际物理奥…

  6. TOOL · CL_96160 ·

    新的Riemann-Bench揭示AI在研究级数学方面存在困难

    一项名为Riemann-Bench的新基准测试已被推出,用于评估AI系统在高级、研究级数学方面的能力,超越了竞赛题的范围。该基准由常春藤盟校的数学教授和专家开发,其特点是问题复杂且耗时,即使对人类来说也是如此。初步评估显示,目前最前沿的AI模型在Riemann-Bench上的得分低于10%,这凸显了它们在数学推理能力与人类研究人员相比存在的巨大差距。该基准测试保持私密,以防止数据记忆并确保对AI数学能力的真实评估。

  7. TOOL · CL_93834 ·

    Gemini 3.0 Pro 管道大幅降低数学问题成本,达到 SOTA

    研究人员开发了一种新的推理管道,显著降低了使用现成 AI 模型解决复杂数学问题的成本。该方法在使用 Gemini 3.0 Pro 的情况下,在 IMO-ProofBench Advanced 基准测试上取得了最先进的性能,而成本仅为先前方法的零头。该管道通过隔离和独立验证候选引理来解决解题器-评分器系统中的常见故障模式,这种技术被称为“上下文分离”。

  8. RESEARCH · CL_91340 ·

    新的大语言模型框架和基准推动形式数学推理发展

    研究人员正在开发新的方法和基准来提高大语言模型(LLMs)的形式数学推理能力。一种名为Diffusion-Proof的方法利用扩散大语言模型(dLLMs)进行定理证明,在ProofNet-Test和MiniF2F-Test等基准测试中表现优于自回归模型,甚至解决了领先模型无法解决的国际数学奥林匹克问题。另一项开发Visored提供了一个旨在通过模仿自然语言和自动化常规步骤来处理大语言模型生成数学的证明器。此外,Mask-Proof引入…

  9. SIGNIFICANT · CL_74924 ·

    LLM 获得 IMO 金牌;谷歌签署 300 亿美元 SpaceX 计算协议

    一个通用大语言模型 (LLM) 在国际数学奥林匹克竞赛中达到了金牌水平的表现,展示了其在超越简单模式识别的创造性推理方面的强大能力。另外,据报道,谷歌已与 SpaceX 达成一项价值 300 亿美元的 AI 计算能力协议,这凸显了对大规模 AI 基础设施日益激烈的竞争。

  10. COMMENTARY · CL_60758 ·

    Google DeepMind 科学家 Yi Tay 在人工智能研究和钢琴演奏之间取得平衡

    Yi Tay 是 Google DeepMind 的一名研究科学家,他是 Gemini 在国际数学奥林匹克竞赛等学术竞赛中取得成功的关键人物。他还为 Gemini 2.5、3 以及 Gemini Deep Think 数学研究论文做出了贡献。在重新加入 Google DeepMind 领导一个专注于推理和 AGI 的新团队之前,Tay 联合创立了 Reka AI,并在那里帮助训练了一个在多模态模型方面可与 GPT-4 相媲美的模型。他…

  11. RESEARCH · CL_05394 ·

    AI 系统使用 Lean 验证证明在 IMO 级别数学中实现 100% 正确性

    六个 AI 系统在 2025 年利用 Lean 验证证明,在 IMO 级别数学问题上取得了满分。这一突破得益于高度严格的验证过程,确保了 AI 解决方案的绝对正确性。此次成功凸显了从人类反馈中强化学习 (RLHF) 与严谨验证方法相结合的潜力。

  12. RESEARCH · CL_06192 ·

    计算机视觉系统利用船载摄像头检测海上集装箱丢失

    研究人员开发了一种计算机视觉系统,用于检测海上不稳定的集装箱,旨在减少造成安全和环境风险的损失。该系统成本低廉,可进行改造,利用现有的船载摄像头来隔离集装箱堆并跟踪它们的相对运动。通过提供早期警报,该系统可以帮助船员进行干预和调整航行,从而提高货物安全和法规遵从性。

  13. FRONTIER RELEASE · CL_01727 ·

    Gemini Deep Think在国际数学奥林匹克竞赛中达到金牌标准

    谷歌DeepMind的Gemini模型的一个进阶版本,利用其“Deep Think”模式,在国际数学奥林匹克竞赛(IMO)中达到了金牌标准。该模型成功解决了六道题中的五道,获得35分,比去年的银牌表现有了显著提升。值得注意的是,今年的Gemini完全以自然语言端到端运行,在比赛时限内直接从问题描述生成证明,这与以往需要翻译成形式语言的系统不同。

  14. FRONTIER RELEASE · CL_01735 ·

    Google DeepMind 为 Gemini Ultra 订阅用户推出 Deep Think

    Google DeepMind 发布了一项名为 Deep Think 的新 AI 功能,现已通过 Gemini 应用提供给 Google AI Ultra 订阅用户。该功能利用并行思考技术,使模型能够同时探索多个想法并延长其解决复杂问题的推理时间。Deep Think 在 LiveCodeBench V6 和 Humanity's Last Exam 等基准测试中表现出了最先进的性能,内部评估显示其在 2025 年国际数学奥林匹克基准…

  15. SIGNIFICANT · CL_00389 ·

    Google DeepMind 利用人工智能加速科学发现和数学研究

    Google DeepMind 正在启动利用人工智能加速科学发现的计划,重点关注与印度的合作以及推进数学研究。该公司正在提供 AlphaGenome 和 AI Co-scientist 等前沿人工智能模型的使用权,以实现科学突破,并支持与顶尖研究机构的“人工智能助力数学计划”。此外,Google Research 开发了一个使用 Gemini 的人工智能系统,该系统可以帮助科学家编写专家级的实证软件,用于假设评估,并在多个科学领域展现…