PulseAugur
中
实时 15:58:32
实体 HMMT 2025

HMMT 2025

PulseAugur coverage of HMMT 2025 — every cluster mentioning HMMT 2025 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_254182 ·

    Lightning Weave框架提升AI推理的准确性和效率

    研究人员开发了Lightning Weave,一个旨在提高推理模型准确性和效率的训练后框架。该方法使用on-policy蒸馏技术,将独立训练模型中的不同能力组合到一个单一的学生模型中。实验表明,在HMMT 2025和LiveCodeBench v5等基准测试中取得了显著的改进,特别是对于Qwen3.5-4B模型,其准确性提高,响应token数减少。

  2. COMMENTARY · CL_248095 ·

    GigaChat 3.5 推理基准测试声明因误导性效率指标而受到质疑

    对人工智能基准测试表的一项最新分析强调了性能声明呈现方式的差异,并以 GigaChat 3.5 Reasoning 模型和 DeepSeek V4 Flash Preview 为例。虽然 GigaChat 公布的基准测试数字是准确的,但其声称在使用少 37% 的 token 的情况下“媲美”DeepSeek V4 Flash 是具有误导性的。文章指出,GigaChat 在某些评估中获胜,但在其他评估中却显著落败,并且效率指标是基于一套…

  3. TOOL · CL_210439 ·

    新研究质疑了当候选答案错误时大型语言模型的聚合策略

    一篇新研究论文探讨了大型语言模型不同聚合策略的有效性,特别是在初始候选答案不正确的情况下。该研究使用 Qwen3-4B 模型在 AIME-2025 和 HMMT-2025 数学基准测试上进行,发现虽然以多个正确候选答案为条件可以提高准确性,但依赖不正确的候选答案实际上会降低性能,与生成全新解决方案相比。研究还指出,显式答案字段可以引导模型输出,但掩盖它们并未带来可衡量的准确性改进。

  4. RESEARCH · CL_160905 ·

    新的 TTEL 算法通过定位错误来提高 LLM 推理效率

    研究人员开发了一种名为“通过错误定位进行测试时扩展”(TTEL)的新型推理时算法,以提高大型语言模型在复杂推理任务上的效率。TTEL 利用反馈来精确定位错误发生的具体 token,从而能够截断错误的路径并为新生成的内容重用有效的词缀。评估表明,TTEL 在 LiveCodeBench、AIME-2025 和 HMMT-2025 等基准测试中显著优于现有方法,以更少的生成 token 实现了更好的性能。

  5. TOOL · CL_106806 ·

    新的TAPO方法通过显式纠错增强LLM推理能力

    研究人员推出了一种名为轨迹增强策略优化(TAPO)的新方法,通过自蒸馏来增强大型语言模型(LLM)的推理能力。与隐式地将模型输出与目标分布对齐的传统方法不同,TAPO显式地构建了纠正性轨迹。这些轨迹保留了错误推理直到失败点,然后结合了来自正确参考样本的自然语言诊断和纠正后的推理。

  6. RESEARCH · CL_98141 ·

    新的TAPO方法通过显式纠错增强LLM自蒸馏 · 跟踪4个来源

    研究人员推出了一种新方法,称为轨迹增强策略优化(TAPO),用于大型语言模型的自蒸馏。与隐式对齐分布的传统方法不同,TAPO显式地构建了纠正性轨迹。这些轨迹保留了错误推理直到失败点,然后纳入自然语言诊断和纠正后的推理。在AIME 2024、AIME 2025和HMMT 2025上的实验表明,与GRPO相比,TAPO提高了初始推理和纠错的有效性。