PulseAugur
中
实时 19:58:53
实体 AIME 2026

AIME 2026

PulseAugur coverage of AIME 2026 — every cluster mentioning AIME 2026 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_279270 ·

    Hugging Face 将 48 个 AI 基准测试整合为交互式地图

    Hugging Face 推出了一个新的交互式地图,整合了其 48 个官方基准测试,全面概述了 AI 模型在各个领域的性能。该地图显示,虽然与代理相关的基准测试数量最多,但由于实际考虑,科学和知识基准测试吸引了最多的提交。参与度不均衡,少数关键基准测试主导着排行榜条目,并且有相当一部分提交来自中国。

  2. TOOL · CL_255981 ·

    7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆

    来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。

  3. COMMENTARY · CL_248095 ·

    GigaChat 3.5 推理基准测试声明因误导性效率指标而受到质疑

    对人工智能基准测试表的一项最新分析强调了性能声明呈现方式的差异,并以 GigaChat 3.5 Reasoning 模型和 DeepSeek V4 Flash Preview 为例。虽然 GigaChat 公布的基准测试数字是准确的,但其声称在使用少 37% 的 token 的情况下“媲美”DeepSeek V4 Flash 是具有误导性的。文章指出,GigaChat 在某些评估中获胜,但在其他评估中却显著落败,并且效率指标是基于一套…

  4. RESEARCH · CL_247850 ·

    AI模型通过形式化证明和新发现解决未解数学难题

    两篇新研究论文探讨了大型语言模型在高级数学推理和发现方面的能力。第一篇论文介绍了Magenta,一个将非正式的自然语言数学问题与Lean 4中形式化、机器可验证的证明联系起来的系统,在奥林匹克竞赛基准测试中取得了完美的准确率,并与K2-Horizon-7B配对解决了六个IMO 2026问题。第二篇论文提出了HorizonMath,一个旨在测试AI进行新颖发现能力的未解数学问题基准,其中GPT-5.4 Pro和GPT-5.6 Sol等模…

  5. TOOL · CL_211559 ·

    Qwen3.8-27B 以 FP8 在 AIME 2026 数学基准测试中获得 29/30 分

    对 Qwen3.8-27B 模型在 AIME 2026 数学数据集上的基准测试显示,其量化的 FP8 权重在设置为 xhigh 推理时,获得了 29/30 的分数。此性能在相同的 xhigh 推理设置下与 BF16 版本相当,但速度显著提高。FP8 xhigh 配置在速度更快的情况下,也达到了 BF16 medium 设置的分数。

  6. SIGNIFICANT · CL_182151 ·

    Google DeepMind 的 DiffusionGemma 通过离散扩散实现每秒 1500 个 token

    Google DeepMind 发布了 DiffusionGemma,这是一个开放权重的语言模型,它利用离散扩散进行文本生成,与传统的自回归模型相比,输出速度显著更快。虽然 DiffusionGemma 在单个 NVIDIA H100 上可以实现大约每秒 1500 个输出 token,但在能力基准测试上的得分低于其自回归对应模型 Gemma 4。这种在服务速度方面的创新对于需要低延迟和高吞吐量的代理系统尤其有益,预示着未来混合模型或智…

  7. TOOL · CL_111725 ·

    新方法使用错误草稿来提升LLM的数学能力

    研究人员开发了一种名为“通过不匹配的错误草稿进行弱到强诱导”的新颖技术,以提高大型语言模型的能力。该方法涉及使用来自较小的、特定领域的模型的数学上不正确的草稿来训练一个更大的模型,其性能优于标准的强化学习微调。该技术在MATH-500和分布外AIME 2025/2026基准测试中显示出显著的提升,为Mathstral-7B模型实现了新的最先进水平。

  8. RESEARCH · CL_107855 ·

    研究发现,仅凭两个因素即可预测AI基准分数

    一篇新研究论文提出了一种名为BenchPress的方法,该方法仅使用两个关键分数即可预测前沿模型在众多基准测试中的表现。该研究分析了84个模型和133个基准测试,发现模型的整体表现主要由两个潜在因素决定。这种方法可以显著减少所需的评估次数,表明仅使用五个基准测试的子集就可以高精度地预测模型的完整评分卡。

  9. TOOL · CL_17412 ·

    Google 的 Gemma 4 26B 模型可在 LM Studio 的新无头 CLI 上本地运行

    Google 的 Gemma 4 模型系列,特别是 26B-A4B 变体,现在可以在 MacBooks 等消费级硬件上进行本地推理。这种混合专家模型在每次推理时仅激活其一部分参数,从而在需要显著更少的内存和计算能力的同时,实现与更大密集模型相当的质量。LM Studio 的最新更新 0.4.0 版本引入了无头 CLI,无需图形界面即可方便地在本地设置和使用 Gemma 4 及其他模型。