MMLU-Pro
PulseAugur coverage of MMLU-Pro — every cluster mentioning MMLU-Pro across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源
独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。
-
Mi:dm K 2.5 Pro 在 MMLU-Pro 上表现强劲,但在长上下文方面遇到困难
Mi:dm K 2.5 Pro 模型在 MMLU-Pro 基准测试中取得了 80.9% 的分数。然而,其在长上下文推理任务上的表现明显较低,仅为 10%。这些结果是独立测量的,而非模型创建者自报。
-
新框架检测 LLM 中隐藏的行为纠缠
研究人员开发了一个新的统计框架,用于检测和量化大型语言模型 (LLM) 之间的行为纠缠。该框架使用信息论指标,特别是难度加权行为纠缠指数 (BEI) 和累积信息增益 (CIG) 指标,来识别可能源于共享训练数据或对齐管道的隐藏依赖关系。对六个模型家族的 18 个 LLM 进行的实验揭示了显著的行为纠缠,这与 MMLU-Pro 和 MATH-500 基准测试中的法官过度背书偏差相关。研究人员证明,通过解纠缠验证器集成重新加权可以缓解这种…
-
轻量级微调剪枝MoE模型,减小尺寸和延迟
研究人员开发了一种使用轻量级微调技术剪枝混合专家(MoE)模型中专家的方法。通过应用LoRA等参数高效适配器,他们可以根据路由器敏感度识别并移除不太关键的专家,从而在不显著降低准确性的情况下显著减小模型尺寸和延迟。该方法在Mixtral-8x7B-Instruct和Qwen1.5-MoE等模型上被证明是有效的,即使移除了一半的专家也能保持具有竞争力的性能。
-
LLM 基准测试显示 Kimi、Qwen3 和 Exaone 模型结果不一
独立基准测试揭示了几款大型语言模型在性能上的差异。Kimi K2 0905 在 GPQA 和 MMLU-Pro 上取得了高分,而 Qwen3 235B A22B 在这些指标上也表现良好,但在长上下文推理方面遇到困难。Exaone 4.0 在各项测试中得分较低,尤其是在推理任务方面。Qwen3 VL 4B 在其通用知识能力和处理困难推理挑战方面的表现之间存在显著差距。
-
HELENA框架通过新颖的协调增强多智能体系统
研究人员推出HELENA,一个新颖的多智能体系统框架,旨在通过整合不同的推理路径并抑制噪声来增强分析能力。HELENA使用蒙特卡洛树搜索和行列式点过程选择互补拓扑,构建一个复合图。然后,一个分层稀疏协调模块仅激活必要的子图,通过压缩的潜在摘要抑制冗余信息。实验表明,HELENA在八个基准测试中取得了最先进的成果,包括在MMLU-Pro上显著的平均提升。
-
大型语言模型提示工程:研究表明,具体性胜过礼貌性
提示工程的最佳实践正在不断发展,新研究表明,礼貌和角色设定等元素并不能可靠地提高大型语言模型的性能。沃顿商学院的研究和 EMNLP 2024 的发现表明,虽然关于输出格式和约束的具体指令会显著影响结果,但包含“魔法词”或详细的角色描述通常会增加噪音而非价值。OpenAI 和 Anthropic 等公司也在改进其指导方针,强调提示的简洁性和直接性,以获得更好、更可预测的结果。
-
Quantiles通过Hugging Face数据集实现无代码AI评估
Quantiles推出了一项新功能,允许用户利用基于配置的方法,无需编写代码即可创建AI评估。该系统支持精确匹配和多项选择等确定性评分风格,使用户能够利用Hugging Face等来源的数据集构建评估。该过程包括定义评估类型、数据集、提示模板和风格,并提供了MMLU-Pro数据集的示例。
-
DeepSeek V4 闪电版在 MMLU-Pro、GPQA Diamond 上表现强劲
DeepSeek V4 发布了新的“闪电”版本,据报道在 MMLU-Pro、GPQA Diamond 和 TruthfulQA 等基准测试中取得了令人印象深刻的分数。该模型因其在同等规模模型中的强劲表现而受到关注,DeepSeek 团队因此次更新而受到祝贺。
-
Llama 3.1 Tulu3 405B 在推理基准测试中表现出性能差距
Llama 3.1 Tulu3 405B 模型在基准测试中表现出显著的性能差异,在 MMLU-Pro 上达到 71.6%,而在 Humanity's Last Exam 上仅获得 3.5%。这一巨大差距凸显了即使是先进的开源模型在处理复杂推理任务方面仍然面临挑战。
-
新的HG-CRC框架增强了LLM在子群体中的风险控制
研究人员开发了一个名为分层组条件共形风险控制(HG-CRC)的新框架,以提高大型语言模型的可靠性。该方法确保风险保证不仅在整体上得到满足,而且在模型用户群体的特定子群体中也得到满足,解决了边际保证可能掩盖群体过度暴露于错误的问题。HG-CRC通过应用分层结构和Bonferroni校正来实现这一点,仅需要一个独立的校准集而无需重新训练模型。在Qwen3-4B和Llama 3.1 8B-Instruct等模型上的评估表明,在ARC Cha…
-
新框架优化多LLM问题规划,平衡成本与质量
研究人员开发了OPTI-Q,一个旨在优化多个大型语言模型(LLM)问题规划的新框架。该系统使用受数据库启发的、基于成本的优化器来创建执行计划,以平衡答案质量与成本、延迟和能源等资源约束。OPTI-Q将LLM调用建模为有向无环图中的算子,并通过使用性能数据库估算不同算子组合的质量和资源使用情况来搜索最优计划。在MMLU-Pro和SimpleQA基准测试上的实验表明,与基线方法相比,OPTI-Q在保持在指定预算内的情况下显著提高了平均答案质量。
-
LLM基准测试结果揭示多个模型的性能 · 追踪9个来源
一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…
-
研究发现LLM多样性指标可能无法衡量多样性
一篇新发表在arXiv上的研究论文质疑了大型语言模型(LLM)集成中常用的多样性指标的有效性。研究发现,这些指标通常更多地与模型的整体能力相关,而不是与实际多样性相关,这使得它们在选择要组合的模型时不可靠。研究表明,虽然存在潜在的互补性,但简单的多数投票增益是有限的,而增益更可靠的预测因素是模型共享错误的程度。
-
新方法利用专家判断和校准来估计LLM的信任度
研究人员开发了一种新颖的方法,通过改编结构化专家判断技术来估计多大型语言模型(LLM)系统的信任度。这种方法被称为不确定性感知信任度估计,它使用上下文感知校准问题来评估个体LLM的可靠性,基于其概率预测的质量。该方法受Cooke风格的对数加权启发,惩罚过于自信的错误预测,并偏好校准良好的专家。在MMLU和MMLU-Pro基准上的评估表明,该技术对于异构LLM设置至关重要,并且能够抵御不可靠或受污染的专家小组,其表现优于朴素聚合方法。
-
Solar Open 2 语言模型拥有 100 万 token 上下文窗口和强大的代理能力
研究人员推出了 Solar Open 2,这是一个拥有 2500 亿参数的混合专家(Mixture-of-Experts)语言模型,专为长时序代理任务而设计。该模型通过混合注意力机制实现了 100 万 token 的上下文窗口,并利用更强的起点和精选的高价值数据进行高效训练。Solar Open 2 在多项英语基准测试中表现领先,包括 MMLU-Pro 和 APEX-Agents 套件,并与其他顶级开放权重模型取得了有竞争力的结果。它…
-
DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布
独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…
-
中国开源大模型比GPT-5节省成本
来自中国的开源大语言模型正成为GPT-5等模型的经济高效替代方案,一些初创公司报告了显著的成本节约。这些模型利用高效的混合专家(MoE)架构,并受益于中国较低的基础设施成本。TokenEase等平台通过统一的API使这些模型能够全球访问,简化了寻求在不牺牲质量的情况下降低费用的开发者的迁移过程。
-
新的 Step-Tagging 框架增强了对语言推理模型的控制
研究人员引入了一个名为 Step-Tagging 的新框架,以更好地控制语言推理模型(LRM)的生成过程。该框架使用轻量级句子分类器实时标注推理步骤,并采用一种名为 ReasonType 的新分类法。通过监控特定推理步骤的数量,可以建立有效的提前停止标准,从而在保持 MATH500、GSM8K、AIME、GPQA 和 MMLU-Pro 等基准测试相当准确率的同时,显著减少 token 使用量(20-50%)。这种方法为研究和控制 LR…
-
开源大模型在多项指标上表现强劲 · 追踪 4 个来源
根据独立测量结果,几款开源人工智能模型在各种基准测试中表现强劲。Mi:dm K 2.5 Pro 在 GPQA 上达到 70.1%,在 MMLU-Pro 上达到 80.9%;MiMo-V2-Flash 在 GPQA 上达到 83.5%,在 Humanity's Last Exam 上达到 20%;Qwen3.5 122B A10B 在 GPQA 上达到 85.7%,在 Humanity's Last Exam 上达到 23.4%;Apr…