PulseAugur
中
实时 17:46:07
实体 International Physics Olympiad

International Physics Olympiad

PulseAugur coverage of International Physics Olympiad — every cluster mentioning International Physics Olympiad across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_228733 ·

    新的ScienceArena基准测试大型语言模型在奥林匹克级别科学问题上的表现

    研究人员开发了ScienceArena,这是一个旨在评估大型语言模型(LLMs)科学推理能力的新基准。该基准利用了近期国际物理奥林匹克、化学奥林匹克和生物学奥林匹克竞赛的题目,这些题目包含多步骤、开放式问题,难以自动评分。评估过程包括专家审核和奥林匹克奖牌获得者的验证以确保准确性,并校准了“大型语言模型即裁判”系统以实现可扩展的评估。对十四个大型语言模型的初步评估表明,虽然顶级模型在某些考试中可以达到奖牌同等分数,但在化学等领域以及在…

  2. RESEARCH · CL_151621 ·

    Loopie Transformer架构在奥林匹克竞赛中取得金牌级表现

    研究人员推出了一种新颖的循环Transformer架构Loopie,旨在克服以往在扩展性方面的限制。Loopie系列包含两个混合专家(MoE)模型:一个拥有200亿参数(其中20亿为激活参数)的版本,以及一个拥有60亿参数(其中6亿为激活参数)的版本。消融研究表明,在同等计算预算下训练时,Loopie的性能显著优于传统的Transformer基线模型。此外,Loopie展现出强大的推理能力,在2025年国际数学奥林匹克竞赛和国际物理奥…

  3. SIGNIFICANT · CL_97397 ·

    Google 升级 Gemini 3 Deep Think 以用于科学和工程领域

    Google 发布了 Gemini 3 Deep Think 的升级版本,这是一种专门用于应对复杂科学、研究和工程挑战的推理模式。新版本已提供给 Google AI Ultra 订阅用户和通过 Gemini API 的部分研究人员。早期测试者已使用 Deep Think 识别同行评审论文中的逻辑缺陷,优化半导体材料的晶体生长,并加速物理组件的设计。该模型还创下了新的基准记录,包括在 Humanity's Last Exam 上设定了新…