GPQA: A Graduate-Level Google-Proof Q&A Benchmark
PulseAugur coverage of GPQA: A Graduate-Level Google-Proof Q&A Benchmark — every cluster mentioning GPQA: A Graduate-Level Google-Proof Q&A Benchmark across labs, papers, and developer communities, ranked by signal.
- instance of long-context reasoning 90%
- instance of GLM-5.2 90%
- instance of SciCode 90%
- instance of MATH500 90%
- competes with MMLU-Pro 70%
- instance of Humanity's Last Exam 70%
- instance of MMLU-Pro 70%
- used by MATH500 70%
- instance of HumanEval 70%
- used by GSM8K 70%
- instance of Artificial Intelligence In Medical Epidemiology 70%
- instance of LiveCodeBench 70%
10 天有情绪数据
-
Qwen3.5 35B A3B 模型在 GPQA 上取得高分且成本效益显著
Qwen3.5 35B A3B 模型展现了令人印象深刻的性能,在 GPQA 基准测试中取得了 81.9% 的分数。它还提供了高智能成本比,每美元提供 35.3 智能点。该模型的速度值得注意,处理速度为每秒 166.7 个 token,其整体性能超出了对其参数量的预期。
-
Anthropic 的 Claude 3.5 Sonnet 在基准测试中超越 Opus,成为构建者的默认选择
Anthropic 发布了 Claude 3.5 Sonnet,这是一款新的中端模型,在推理和编码基准测试中超越了其前旗舰 Claude 3 Opus。此次发布显著提高了成本效益比,使 Sonnet 3.5 成为生产环境中 AI 应用的推荐选择,尤其是在涉及智能体编码任务时。该模型比其前代产品更快、更便宜、更智能,在视觉能力和图像文本转录方面取得了显著进步。
-
Sarvam 30B 模型性能指标在基准测试中公布
Sarvam AI 发布了其 Sarvam 30B 模型,目前已公布多个基准测试的性能指标。该模型在 GPQA 上达到 63.3%,在 Humanity's Last Exam 上达到 7.5%,在 SciCode 上达到 19.2%。值得注意的是,它在长上下文推理任务上得分为 0%,并且其成本效益以每美元 136.2 智能点突出显示。
-
Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源
独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。
-
Kimi K2.7 Code 在 GPQA 上取得高分和高令牌速度
Kimi K2.7 Code 在 GPQA 基准测试中取得了 89.6% 的分数,处理速度为每秒 40.5 个令牌。该模型的一个关键亮点是其效率,表现为每美元获得 25.1 个智能点数。
-
研究发现:数据重复在大型语言模型微调中优于数据扩展
一项新的研究论文表明,对于推理语言模型的监督微调,数据重复比数据扩展更有效。研究发现,在较小的数据集上训练更多轮次,即使达到完全记忆的程度,也能在 Olmo3-7B 模型上针对 AIME'24/25 和 GPQA 等基准测试中获得更好的泛化能力。这种方法优于在更大的数据集上训练一轮,证明了 token 准确性可以作为 SFT 的可靠停止标准。
-
新的DRBENCHER基准测试AI代理的综合浏览和数学技能
研究人员推出了DRBENCHER,这是一个旨在评估AI代理结合网络浏览和多步数学计算能力的基准。与以往单独评估这些技能的基准不同,DRBENCHER从知识图中综合问题,要求代理识别实体、检索属性并执行特定领域的计算。该基准涵盖五个领域:生物化学、金融、地球物理学、安全和历史。人工评估显示有效率为76%,其中相当一部分错误归因于过时的知识图数据,而即使是先进的前沿模型在该基准上的准确率也仅为20%。
-
LLM 基准测试显示 Kimi、Qwen3 和 Exaone 模型结果不一
独立基准测试揭示了几款大型语言模型在性能上的差异。Kimi K2 0905 在 GPQA 和 MMLU-Pro 上取得了高分,而 Qwen3 235B A22B 在这些指标上也表现良好,但在长上下文推理方面遇到困难。Exaone 4.0 在各项测试中得分较低,尤其是在推理任务方面。Qwen3 VL 4B 在其通用知识能力和处理困难推理挑战方面的表现之间存在显著差距。
-
韩国AI模型因“借鉴”技术和狭隘基准测试面临审查 · 跟踪1个来源
在中国知乎平台上的一场病毒式辩论,对声称超越DeepSeek的韩国人工智能模型浪潮进行了审视。批评集中在几个方面:模型被指控建立在其他实验室的开放权重模型之上(例如SK Telecom的A.X K2使用了阿里巴巴的Qwen2.5),狭隘的基准测试选择忽略了更广泛的性能指标,以及为获得政府资助而进行的声称。在这些批评声中,初创公司VIDRAFT成为一个例外,其Darwin-398B-JGOS模型在GPQA基准测试中取得了特定、可验证的排…
-
Divergence Decoding 在无需重新训练的情况下融合 LLM 能力
研究人员推出了一种名为 Divergence Decoding 的新型训练无关框架,旨在将专业科学语言模型的能与通用模型融合。该方法使用 Jensen-Shannon 散度来监测模型间的分布差异,当专家模型显示出显著差异时,动态地路由到通用模型。在 Qwen 和 Llama 系列模型上,跨越 GPQA 和 ChemBench 等基准测试,Divergence Decoding 表现优于单一模型基线,预示着 LLM 推理时自适应协作的新范式。
-
AI 代理的性能取决于结果,而不仅仅是基准测试
Aysan Isayo 指出,MMLU 和 GPQA 等基准测试并不能准确反映 AI 代理的实际性能。虽然基准测试侧重于答案的正确性,但代理的实际效用更多地取决于上下文、检索能力、工具集成和工作流程设计等因素。这些要素对于实现成功的成果通常比模型的原始基准测试分数更关键。
-
AI 基准测试污染可追溯至管道错误;分数被撤回
一个管道错误导致包括 GPQA 在内的四个 AI 基准测试受到污染。该问题源于 GPQA 评估集在 Hugging Face 上以 'train' 标签发布,导致一个管道根据名称而非预期含义错误地选择了它。这一疏忽已导致这些基准测试的分数被撤回,未来的数据集将 undergo allowlist validation and n-gram screening 以防止再次发生。
-
LLM基准测试结果揭示多个模型的性能 · 追踪9个来源
一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…
-
Soofi联盟因数据污染撤回GPQA基准分数
德国Soofi联盟已撤回其基准分数,原因是发现其训练数据包含GPQA评估集的释义问题。这种污染意味着之前报告的GPQA-Diamond基准11.1分的提升不再是衡量模型能力的有效指标。一名研究人员发现了这个问题,Soofi团队在一周内确认了数据污染。
-
DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布
独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…
-
新的 Step-Tagging 框架增强了对语言推理模型的控制
研究人员引入了一个名为 Step-Tagging 的新框架,以更好地控制语言推理模型(LRM)的生成过程。该框架使用轻量级句子分类器实时标注推理步骤,并采用一种名为 ReasonType 的新分类法。通过监控特定推理步骤的数量,可以建立有效的提前停止标准,从而在保持 MATH500、GSM8K、AIME、GPQA 和 MMLU-Pro 等基准测试相当准确率的同时,显著减少 token 使用量(20-50%)。这种方法为研究和控制 LR…
-
开源大模型在多项指标上表现强劲 · 追踪 4 个来源
根据独立测量结果,几款开源人工智能模型在各种基准测试中表现强劲。Mi:dm K 2.5 Pro 在 GPQA 上达到 70.1%,在 MMLU-Pro 上达到 80.9%;MiMo-V2-Flash 在 GPQA 上达到 83.5%,在 Humanity's Last Exam 上达到 20%;Qwen3.5 122B A10B 在 GPQA 上达到 85.7%,在 Humanity's Last Exam 上达到 23.4%;Apr…
-
新的“表示作为评判者”方法使用小型模型进行评估
研究人员提出了一种新的语言模型评估方法,称为表示作为评判者(Representation-as-a-Judge),该方法利用小型模型的内部表示,而不是其生成输出。这种方法基于语义容量不对称性假说(Semantic Capacity Asymmetry Hypothesis),该假说认为评估所需的语义容量少于生成。提出的框架 INSPECTOR 利用了小型模型的这些内部特征来预测评估分数,为传统的 LLM 作为评判者方法提供了一种更有效…
-
Qwen 3.6 量化模型显示智能体性能下降,知识回忆保持稳定
一个大学 HPC 集群对 Qwen 3.6 量化模型进行了基准测试,结果显示较低精度的版本在 Terminal-Bench 2 评估的智能体性能方面显著下降。虽然通过 GPQA Diamond 评估的知识回忆能力受量化影响很小,但与 Qwen 官方的 FP8 分数相比,研究观察到了一个显著的下降,这可能归因于不同的超时设置。研究人员还在对 GLM-5.2 量化模型进行基准测试,尽管这一过程被证明非常缓慢。
-
新方法惩罚冗余,使大语言模型推理更高效
研究人员开发了一种新颖的方法,通过惩罚其思维链(CoT)追踪中的内部和外部冗余来减少大型推理模型(LRM)的“过度思考”。这种双重惩罚强化学习框架分别解决了第一个正确答案之前的信��停滞和之后的冗余延续问题。在GSM8K和MATH500等基准测试上的实验表明,推理长度显著缩短,在1.5B模型上最多可减少41.3%,同时保持了具有竞争力的准确性并提高了整体效率。该方法还显示出对GPQA和LiveCodeBench等域外任务的可迁移性,为…