PulseAugur
实时 19:40:09
实体 AIME 2026

AIME 2026

PulseAugur coverage of AIME 2026 — every cluster mentioning AIME 2026 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. SIGNIFICANT · CL_182151 ·

    Google DeepMind 的 DiffusionGemma 通过离散扩散实现每秒 1500 个 token

    Google DeepMind 发布了 DiffusionGemma,这是一个开放权重的语言模型,它利用离散扩散进行文本生成,与传统的自回归模型相比,输出速度显著更快。虽然 DiffusionGemma 在单个 NVIDIA H100 上可以实现大约每秒 1500 个输出 token,但在能力基准测试上的得分低于其自回归对应模型 Gemma 4。这种在服务速度方面的创新对于需要低延迟和高吞吐量的代理系统尤其有益,预示着未来混合模型或智…

  2. TOOL · CL_111725 ·

    新方法使用错误草稿来提升LLM的数学能力

    研究人员开发了一种名为“通过不匹配的错误草稿进行弱到强诱导”的新颖技术,以提高大型语言模型的能力。该方法涉及使用来自较小的、特定领域的模型的数学上不正确的草稿来训练一个更大的模型,其性能优于标准的强化学习微调。该技术在MATH-500和分布外AIME 2025/2026基准测试中显示出显著的提升,为Mathstral-7B模型实现了新的最先进水平。

  3. RESEARCH · CL_107855 ·

    研究发现,仅凭两个因素即可预测AI基准分数

    一篇新研究论文提出了一种名为BenchPress的方法,该方法仅使用两个关键分数即可预测前沿模型在众多基准测试中的表现。该研究分析了84个模型和133个基准测试,发现模型的整体表现主要由两个潜在因素决定。这种方法可以显著减少所需的评估次数,表明仅使用五个基准测试的子集就可以高精度地预测模型的完整评分卡。

  4. TOOL · CL_17412 ·

    Google 的 Gemma 4 26B 模型可在 LM Studio 的新无头 CLI 上本地运行

    Google 的 Gemma 4 模型系列,特别是 26B-A4B 变体,现在可以在 MacBooks 等消费级硬件上进行本地推理。这种混合专家模型在每次推理时仅激活其一部分参数,从而在需要显著更少的内存和计算能力的同时,实现与更大密集模型相当的质量。LM Studio 的最新更新 0.4.0 版本引入了无头 CLI,无需图形界面即可方便地在本地设置和使用 Gemma 4 及其他模型。