PulseAugur
中
实时 17:38:17
实体 MMLU-Pro

MMLU-Pro

PulseAugur coverage of MMLU-Pro — every cluster mentioning MMLU-Pro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
71
90 天内 71
发布 · 30天
0
90 天内 0
论文 · 30天
37
90 天内 37
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/4 页 · 共 73 条
  1. TOOL · CL_283927 ·

    复杂的KDA实现了线性注意力中的旋转,以进行高级状态跟踪

    研究人员详细介绍了一种名为复杂KDA(CKDA)的新型线性注意力机制,该机制允许在内存更新中进行旋转,从而实现比以往线性模型更复杂的国家跟踪。该机制建立在Moonshot AI的Kimi Linear架构之上,使用带符号门和特定的更新参数来实现这些旋转,这对于计数和跟踪状态至关重要。这项发表在arXiv上的突破表明,CKDA可以表示复杂的有限群,显著增强了线性注意力模型的表达能力。

  2. TOOL · CL_283709 ·

    MoE模型的稀疏激活影响4位量化质量

    混合专家(MoE)模型尽管参数量巨大,但对于任何给定的token,仅使用其中一小部分参数。这种稀疏性意味着4位量化对MoE模型的影响与对密集模型不同。虽然MoE模型可以容忍对其较少使用的“专家”参数进行更激进的量化,但像路由器和始终激活的张量等关键组件需要更高的精度来维持准确性。混合精度量化技术,例如Unsloth的UD-Q4_K_XL,通过对“冷路径”参数应用较低精度,同时将“热路径”参数保持在较高精度,从而保留准确性,这种方法可以…

  3. SIGNIFICANT · CL_283684 ·

    EmpirioLabsAI 发布 Aplomb 1,一款拥有 1M 上下文的 5.3B 决策模型

    EmpirioLabsAI 发布了 Aplomb 1,这是一款开放权重的决策模型,拥有 53 亿参数。该模型拥有 100 万 token 的上下文窗口,并能在单次请求中处理文本、图像、视频和音频。在决策指数的 8 项基准测试中,包括 MMLU-Pro 和 GPQA Diamond,它在高达 53 亿参数的模型中取得了最高分。Aplomb 1 基于 Qwen3.5-4B 和 Qwen3-Omni-30B-A3B-Instruct 构建,…

  4. TOOL · CL_283057 ·

    180B 参数 AI 模型通过量化在消费级硬件上运行

    名为 POCKET-Darwin-180B-GGUF 的 Darwin-180B-RSI 模型的量化版本已发布,使其无需专用 GPU 即可在消费级硬件上运行。这个 111 GB 的模型采用了专家混合(MoE)架构,这意味着其 1800 亿参数中只有一小部分在每个 token 生成时处于激活状态。该模型在具有足够 RAM 的 CPU 上可以达到每秒 21 个 token 的速度,或者在 RAM 较少的笔记本电脑上通过利用 SSD 加载权…

  5. TOOL · CL_282642 ·

    Granite 4.0 1B 模型展示独立基准测试结果

    Granite 4.0 1B 模型在多项基准测试中展示了性能指标,包括 GPQA 为 28.1%,MMLU-Pro 为 32.5%,HLE 为 4.8%,长上下文为 6%。这些结果是独立测量的,而非自报,为该尺寸模型的性能提供了透明的视图。

  6. TOOL · CL_282248 ·

    VIDRAFT 通过新的 QuantID 仪表板在 10 项 Hugging Face 基准测试中领先

    QuantID 创建的一个新的实时仪表板将所有 48 项官方 Hugging Face 基准测试排行榜整合到一个视图中。该工具直接从 Hugging Face 的公共 API 聚合数据,展示参与模式和排名。值得注意的是,在 FINAL-Bench 组织下运营的韩国人工智能初创公司 VIDRAFT 目前在 48 项基准测试中的 10 项中处于领先地位,超越了所有其他组织。

  7. TOOL · CL_282080 ·

    180B 人工智能模型通过 4 位量化在笔记本电脑上运行

    一种新方法允许一个拥有 1800 亿参数的模型 POCKET-Darwin-180B-GGUF 在没有专用 GPU 的消费级硬件上运行。这是通过模型的稀疏专家混合架构(每个 token 只激活其一部分参数)和选择性的 4 位量化过程(保留关键权重的准确性)相结合实现的。量化后的模型以 GGUF 格式提供,需要显著更少的存储和内存,使其能够在具有至少 8GB VRAM 的笔记本电脑上运行,甚至在具有足够 RAM 的迷你 PC 上运行,同…

  8. SIGNIFICANT · CL_282079 ·

    开放180B模型Darwin-180B-RSI引领10项Hugging Face基准测试

    一个名为Darwin-180B-RSI的开放权重模型在10个Hugging Face官方排行榜上名列前茅,超越了所有其他参与组织。该模型由VIDRAFT基于Alibaba的Qwen3.8-Flash-Next构建,不仅在MMLU-Pro和GPQA等学术基准测试中表现出色,还在文档解析(MDPBench)、结构化数据输出(IFStruct)和PDF字段提取(ExtractBench)等实际的企业级任务中展现出强大性能。该模型的训练方法,…

  9. COMMENTARY · CL_281389 ·

    LLM基准测试平均方法存在缺陷,偏袒测试次数少的模型

    最近对LLM基准测试排行榜的分析揭示了平均方法论的缺陷,尤其是在模型在不同数量的基准测试上进行测试时。最初的方法是将归一化分数跨类别平均,无意中偏袒了在较少、较容易的基准测试中取得结果的模型,而不是那些在更具挑战性的评估中进行了广泛测试的模型。这导致了数据有限的模型优于结果全面的模型,凸显了需要更稳健的方法来准确评估LLM的能力。

  10. RESEARCH · CL_280720 ·

    Darwin-180B-RSI凭借递归自改进在9项Hugging Face基准测试中领先

    VIDRAFT的Darwin-180B-RSI模型家族在9项官方Hugging Face基准测试中均取得第一名,超越了所有其他参与组织。该开源模型采用了递归自改进技术,即它解决可验证的问题,只保留正确的解决方案,并在没有人类生成答案的情况下进行再训练。值得注意的是,它在结构化输出生成(IFStruct)和从PDF提取数据(ExtractBench)等实际任务中表现出色,展示了其在现实世界中的应用潜力。

  11. TOOL · CL_280368 ·

    新方法以最少数据将AR模型转换为扩散LLM

    研究人员开发了一种低成本方法,将自回归(AR)模型转换为扩散语言模型(dLLM),从而无需大量重新训练即可实现并行生成。一项比较两种转换技术(就地转换和冻结塔转换)的研究发现,在HumanEval等基准测试中,冻结塔模型显著优于就地转换模型,实现了11.6倍的改进。冻结塔方法在GSM8K和MMLU-Pro任务上还保留了父模型更高百分比的性能,表明它在转换过程中更有效地保留知识,尤其是在有限的训练预算内。

  12. RESEARCH · CL_279269 ·

    Hugging Face 排行榜:基准测试如何被填充和查看

    Hugging Face 维护着 48 个官方基准测试的排行榜,这些排行榜通过模型仓库中的 .eval_results YAML 文件由模型作者提交结果来填充。这些排行榜由 Hugging Face 自动组装,并非由基准测试所有者直接上传。大约 30% 的条目在默认视图中不可见,需要进行特定过滤。 “Agents and terminal”类别包含的基准测试最多,而 “Science and knowledge”类别包含的条目最多,其…

  13. TOOL · CL_279270 ·

    Hugging Face 将 48 个 AI 基准测试整合为交互式地图

    Hugging Face 推出了一个新的交互式地图,整合了其 48 个官方基准测试,全面概述了 AI 模型在各个领域的性能。该地图显示,虽然与代理相关的基准测试数量最多,但由于实际考虑,科学和知识基准测试吸引了最多的提交。参与度不均衡,少数关键基准测试主导着排行榜条目,并且有相当一部分提交来自中国。

  14. TOOL · CL_278936 ·

    DeepSeek R1 模型展示了强大的基准性能,但成本效益是关键

    DeepSeek 的 R1 模型于 2025 年 1 月发布,在 MMLU-Pro 和 GPQA 基准测试中取得了显著的成绩,分别达到了 84.4% 和 70.8%。然而,该模型的成本效益得到了强调,其“每美元智能点数”指标为 4.6,这表明它可能是用户的一个重要考虑因素。

  15. SIGNIFICANT · CL_276902 ·

    VIDRAFT 发布可在消费级笔记本电脑上运行的 180B LLM

    VIDRAFT 发布了 POCKET-Darwin-180B,这是其 1800 亿参数 Darwin-180B-RSI 模型的 4 位量化版本。该版本兼容 llama.cpp,可以通过利用稀疏专家混合路由和一种新颖的嫁接量化技术,在包括没有专用 GPU 的笔记本电脑在内的消费级硬件上运行。该模型的尺寸已从 360 GB 减至 111 GB,与传统的企业级 GPU 设置相比,能够以显著更低的硬件成本和系统 RAM 要求进行本地推理,同时…

  16. SIGNIFICANT · CL_274979 ·

    Cloudflare 发布 Clef 决策模型,支持类型化概率输出

    Cloudflare 推出了 Clef 和 Clef-flash,这是两个开放权重的决策模型,专为特定问题回答而非通用文本生成而设计。这些模型基于 Qwen 主干构建,并兼容 TypeSafe AI Jev API,能够为关于输入状态(包括文本、图像和视频)的预定义问题返回类型化概率。虽然 Clef 和 Clef-flash 在 Banking77 和 CLINC150+OOS 等某些基准测试中表现优于 Jev,但在 GPQA Dia…

  17. RESEARCH · CL_268862 ·

    新研究探讨大语言模型的测试时扩展,解决吸引子和信任问题

    三篇新研究论文探讨了改进大型语言模型测试时扩展的方法,这是一种允许模型在推理时花费额外计算来增强推理和解决问题能力的技术。第一篇论文指出,顺序扩展方法可能会陷入吸引子,阻碍进一步改进,并提出了一种模型混合干预措施来摆脱这些状态。第二篇论文侧重于信任来自测试时扩展曲线的准确性声明的挑战,提出了一种更有效的方法来认证这些曲线。第三篇论文介绍了“爬山采样”,这是复杂进化策略的更简单有效的替代方案,通过将样本条件化为先前找到的最佳解决方案,在…

  18. TOOL · CL_268703 ·

    新的 MoMHa 系统优化 LLM Harness,平衡准确性、安全性和 Token 成本

    研究人员开发了 MoMHa,一个用于优化大型语言模型 (LLM) Harness 的新系统。与以往只关注准确性的方法不同,MoMHa 将准确性、行为安全性和 Token 成本视为多目标标准。该系统利用一个具有代理功能的提案者 Claude Code,该提案者可以广泛访问先前的 Harness 设计和执行数据,以搜索最优的 Harness 配置。在合成和真实世界基准测试中,使用 12 种不同模型的评估表明,MoMHa 在联合奖励、行为安…

  19. TOOL · CL_281698 ·

    新的尾部影响采样方法改进了在最坏情况下的AI策略评估

    研究人员开发了尾部影响采样(TIS)方法,这是一种在有限评估预算下更准确地估计AI策略在最坏情况(CVaR)下性能的新方法。TIS识别随机工作流中对尾部风险影响最大的组成部分,并将查询重新分配到这些关键区域。在CliffWalking上的实验中,与完整运行相比,TIS将均方误差(MSE)降低了76%;在语言模型审查任务中,其MSE显著低于标准方法。

  20. TOOL · CL_269446 ·

    新的大语言模型辩论协议追踪最终准确度之外的崩溃与修正

    研究人员开发了一种新的协议来评估多智能体大语言模型(LLM)辩论,超越了简单的最终答案准确性。该协议在 NeurIPS 2026 上发表的一篇论文中详细介绍,使用转换分类账来追踪崩溃(最初正确的答案变为不正确)和修正(最初不正确的答案变为正确)等机制。对 6,925 场 MMLU-Pro 辩论的分析揭示了 253 次崩溃,突显了一种权衡,即防止崩溃也可能阻止有价值的修正。研究发现,许多崩溃发生在辩论的初始轮次,这表明早期的分歧可能导致…