PulseAugur
中
实时 23:56:29
实体 GPQA: A Graduate-Level Google-Proof Q&A Benchmark

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

PulseAugur coverage of GPQA: A Graduate-Level Google-Proof Q&A Benchmark — every cluster mentioning GPQA: A Graduate-Level Google-Proof Q&A Benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
63
90 天内 63
发布 · 30天
0
90 天内 0
论文 · 30天
36
90 天内 36
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/4 页 · 共 69 条
  1. TOOL · CL_285118 ·

    DeepSeek V4 Flash 0420 取得强劲基准分数

    DeepSeek V4 Flash 0420 (Max) 在多项基准测试中取得了显著分数,包括 GPQA 的 89.4% 和 SciCode 的 45.3%。该模型在长上下文推理方面也表现出色,得分为 74.3%。这些结果使 DeepSeek V4 Flash 0420 成为开源 AI 领域中的有力竞争者,每美元拥有 144 智能点。

  2. TOOL · CL_284757 ·

    新的训练方法教会LLM在不确定时弃权

    研究人员开发了一种名为强化犹豫(RH)的新训练方法,通过教会语言模型在不确定时放弃回答,使其更加值得信赖。与奖励任何回答的传统方法不同,RH使用三元奖励,对错误回答的惩罚比弃权更严重。在逻辑谜题、医学问题和高等数学问题上的实验表明,RH能有效训练模型校准其诚实度,不同的惩罚级别可以产生针对不同风险容忍度的优化模型。该研究还引入了级联和自级联等推理策略,利用弃权作为协调信号,以更低的计算成本优于多数投票。

  3. TOOL · CL_282642 ·

    Granite 4.0 1B 模型展示独立基准测试结果

    Granite 4.0 1B 模型在多项基准测试中展示了性能指标,包括 GPQA 为 28.1%,MMLU-Pro 为 32.5%,HLE 为 4.8%,长上下文为 6%。这些结果是独立测量的,而非自报,为该尺寸模型的性能提供了透明的视图。

  4. TOOL · CL_282248 ·

    VIDRAFT 通过新的 QuantID 仪表板在 10 项 Hugging Face 基准测试中领先

    QuantID 创建的一个新的实时仪表板将所有 48 项官方 Hugging Face 基准测试排行榜整合到一个视图中。该工具直接从 Hugging Face 的公共 API 聚合数据,展示参与模式和排名。值得注意的是,在 FINAL-Bench 组织下运营的韩国人工智能初创公司 VIDRAFT 目前在 48 项基准测试中的 10 项中处于领先地位,超越了所有其他组织。

  5. SIGNIFICANT · CL_282079 ·

    开放180B模型Darwin-180B-RSI引领10项Hugging Face基准测试

    一个名为Darwin-180B-RSI的开放权重模型在10个Hugging Face官方排行榜上名列前茅,超越了所有其他参与组织。该模型由VIDRAFT基于Alibaba的Qwen3.8-Flash-Next构建,不仅在MMLU-Pro和GPQA等学术基准测试中表现出色,还在文档解析(MDPBench)、结构化数据输出(IFStruct)和PDF字段提取(ExtractBench)等实际的企业级任务中展现出强大性能。该模型的训练方法,…

  6. RESEARCH · CL_280720 ·

    Darwin-180B-RSI凭借递归自改进在9项Hugging Face基准测试中领先

    VIDRAFT的Darwin-180B-RSI模型家族在9项官方Hugging Face基准测试中均取得第一名,超越了所有其他参与组织。该开源模型采用了递归自改进技术,即它解决可验证的问题,只保留正确的解决方案,并在没有人类生成答案的情况下进行再训练。值得注意的是,它在结构化输出生成(IFStruct)和从PDF提取数据(ExtractBench)等实际任务中表现出色,展示了其在现实世界中的应用潜力。

  7. TOOL · CL_280384 ·

    新的Mesh Learning方法可防止RLVR训练的LLM出现策略崩溃

    研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。

  8. TOOL · CL_278936 ·

    DeepSeek R1 模型展示了强大的基准性能,但成本效益是关键

    DeepSeek 的 R1 模型于 2025 年 1 月发布,在 MMLU-Pro 和 GPQA 基准测试中取得了显著的成绩,分别达到了 84.4% 和 70.8%。然而,该模型的成本效益得到了强调,其“每美元智能点数”指标为 4.6,这表明它可能是用户的一个重要考虑因素。

  9. COMMENTARY · CL_276219 ·

    Anthropic、OpenAI引领AI竞赛;开源模型缩小差距 · 跟踪1个来源

    2026年秋季,AI领域由Anthropic的Claude Opus 5.5和OpenAI的GPT-6 Astra主导,它们在编码、推理和知识基准测试中领先。Moonshot和DeepSeek等实验室的开源模型正在迎头赶上,大约落后三到八个月。对于开发者来说,订阅成本和使用限制正变得比微小的基准分数差异更关键,GPT-6.1 Sol和Sonnet 5.5等模型的定价在中端市场正在崩溃。

  10. TOOL · CL_283122 ·

    Fireworks AI 在基准调查后发布 GLM-5.3-Flash

    Fireworks AI 已宣布在其平台上推出 GLM-5.3-Flash。据报道,由于在基准性能方面发现差异,特别是在 AIME 和 GPQA 等推理密集型任务上,该发布推迟了两天。该公司强调其对质量的承诺,并表示推迟是为了调查和解决问题。

  11. TOOL · CL_274340 ·

    Step3 VL 10B 在基准测试中表现不一

    对 Step3 VL 10B 模型的新评估显示,该模型在不同基准测试中存在显著的性能差异。该模型在 GPQA 基准测试中获得了 69% 的分数,表明其在研究生水平的问答方面表现强劲。然而,在长上下文推理任务上,其得分仅为 0%,凸显了其在处理扩展信息方面的关键弱点。

  12. RESEARCH · CL_258923 ·

    DeepSeek V4 Pro 和 Nova 2.0 Lite 基准测试公布 · 跟踪 2 个来源

    独立基准测试揭示了两个大型语言模型 DeepSeek V4 Pro 和 Nova 2.0 Lite 的性能。DeepSeek V4 Pro 在侧重推理的任务中取得了高分,GPQA 得分为 92.8%,长上下文推理得分为 80.3%。Nova 2.0 Lite 被描述为非推理模型,在这些基准测试中的得分较低,但提供了更高的每美元智能点数指标。

  13. TOOL · CL_256749 ·

    Qwen3 Omni 30B A3B Instruct 的基准测试结果喜忧参半,在某些领域表现出色,但在长上下文推理方面失败

    Qwen3 Omni 30B A3B Instruct 模型在特定基准测试中表现强劲,GPQA 达到 62%,MMLU-Pro 达到 72.5%。然而,它在长上下文推理方面没有表现出任何能力。根据独立测量,该模型运行速度为每秒 108.2 个 token,每美元提供 14 个“智能点”。

  14. TOOL · CL_250827 ·

    DeepSeek-V4 Flash 0731 在 GPQA 和 HLE 上取得强劲分数

    DeepSeek-V4 Flash 0731 在 GPQA 基准测试中取得了 90.8% 的分数,在 HLE 上取得了 38.6% 的分数。该模型还展示了每秒 233.8 个 token 的速度。值得注意的是,它提供了高智能成本比,每美元提供 52.3 个智能点,在大型语言模型领域中成为一个高效的选择。

  15. TOOL · CL_243485 ·

    Seed-OSS-36B-Instruct 在基准测试中实现高成本效益

    根据独立测量,Seed-OSS-36B-Instruct 的每美元智能点成本效益达到了 40.3。该模型在 GPQA 基准测试中得分 72.6%,在 MMLU-Pro 中得分 81.5%。这些结果表明,Seed-OSS-36B-Instruct 相对于其成本提供了具有竞争力的性能,有可能挑战更大、更昂贵的模型。

  16. TOOL · CL_240266 ·

    Solar Pro 4 在 GPQA 上达到 89.1%,效率表现强劲

    Solar Pro 4 在 GPQA 基准测试中取得了 89.1% 的分数,在研究生水平的问答方面表现强劲。该模型还展示了每秒 59.1 个 token 的效率,每美元获得 62.3 个智能点,表明速度和成本效益取得了良好的平衡。这些结果是独立测量的,可与其他模型进行比较。

  17. TOOL · CL_237569 ·

    GLM-5.1 (非推理) 在 GPQA 基准测试中达到 83.9%

    一项新的基准评估显示,GLM-5.1 (非推理) 在 GPQA 基准测试中取得了 83.9% 的分数。此性能由独立机构测量,突显了该模型的效率,每花费一美元可提供 13.3 个智能点数。

  18. TOOL · CL_232771 ·

    Qwen3.5 2B在独立基准测试中表现参差不齐

    独立基准测试显示,Qwen3.5 2B(一个非推理模型)在GPQA基准测试中取得了43.8%的成绩。然而,在更复杂的任务上,其表现显著下降,在HLE上仅得5%,在长上下文推理上仅得15%,在SciCode上仅得7.2%。这表明在具有挑战性的评估中存在显著的性能差距。

  19. TOOL · CL_232335 ·

    Qwen3.6 和 Qwen3.5 推理速度相似,在智能体任务中有所提升

    最近对 Qwen3.6 和 Qwen3.5 模型进行的基准测试比较显示,它们在 GeForce RTX 4070 上的推理速度几乎相同,这与最初认为速度显著下降的发现相反。这种差异归因于一个消耗 VRAM 的后台进程,该进程影响了两个模型。在解决了干扰后,Qwen3.6 和 Qwen3.5 都保持了大约每秒 37 个 token 的速度。Qwen3.6 的主要改进体现在需要工具调用、长上下文推理和多轮执行的任务中,在前端生成基准测试中…

  20. TOOL · CL_231543 ·

    新研究表明强化学习增强语言模型采样效率,而非新的推理能力

    一项新的研究论文探讨了强化学习(RL)如何影响语言模型的推理能力,特别是它是否引入了新的推理能力还是增强了现有能力的采样。该研究引入了一个统一解码框架(UDF)来分析token级别的采样和搜索策略。在Math500和GPQA等基准测试上的结果表明,RL的收益在很大程度上可归因于现有能力的采样效率提高,而不是全新的推理技能。