PulseAugur
实时 11:05:26
实体 Humanity's Last Exam

Humanity's Last Exam

PulseAugur coverage of Humanity's Last Exam — every cluster mentioning Humanity's Last Exam across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
13
90 天内 36
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/2 页 · 共 36 条
  1. TOOL · CL_212063 ·

    新的Qworld方法生成特定问题的LLM评估标准

    研究人员推出了一种新颖的大型语言模型(LLM)评估方法Qworld,通过生成特定于问题的标准来进行评估。该方法通过为每个单独的问题创建详细的、上下文感知的评估标准,解决了静态评分标准存在的局限性。Qworld将问题分解为场景、视角和细粒度标准,揭示了LLM在长期影响和跨学科推理等领域的能力差异,而这些差异往往会被更广泛的指标所忽略。

  2. TOOL · CL_206326 ·

    新的 HLE-Verified 基准修正了 Humanity's Last Exam 中的错误

    研究人员开发了 HLE-Verified,这是 Humanity's Last Exam (HLE) 基准的一个修订版本,旨在解决有关噪声数据和有偏评估的担忧。新基准采用两阶段验证和修复过程,包括专家审查和基于模型的交叉检查,以确保准确性。在测试最先进的语言模型时,HLE-Verified 显示平均准确率提高了 7-10 个百分点,在包含原始问题陈述或答案错误的条目上有了显著改进。

  3. TOOL · CL_203015 ·

    Sarvam 30B 模型性能指标在基准测试中公布

    Sarvam AI 发布了其 Sarvam 30B 模型,目前已公布多个基准测试的性能指标。该模型在 GPQA 上达到 63.3%,在 Humanity's Last Exam 上达到 7.5%,在 SciCode 上达到 19.2%。值得注意的是,它在长上下文推理任务上得分为 0%,并且其成本效益以每美元 136.2 智能点突出显示。

  4. RESEARCH · CL_201933 ·

    Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源

    独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。

  5. SIGNIFICANT · CL_199066 ·

    OpenAI 发布 GPT-5.6 Sol,推出速度提升 14 倍的“超快模式” · 跟踪 2 个来源

    OpenAI 为其 GPT-5.6 Sol 模型推出“超快模式”,速度比之前版本快高达 14 倍。这项通过 OpenAI API 提供并由 Cerebras 提供支持的新服务级别,每秒可输出高达 750 个 token。基准测试显示,超快模式下的 GPT-5.6 Sol 在速度上显著优于 Claude Fable-5 和 Opus 4.8 等模型,尤其是在 Humanity's Last Exam 等具有挑战性的基准测试中,同时保持了…

  6. RESEARCH · CL_188546 ·

    LLM 基准测试显示 Kimi、Qwen3 和 Exaone 模型结果不一

    独立基准测试揭示了几款大型语言模型在性能上的差异。Kimi K2 0905 在 GPQA 和 MMLU-Pro 上取得了高分,而 Qwen3 235B A22B 在这些指标上也表现良好,但在长上下文推理方面遇到困难。Exaone 4.0 在各项测试中得分较低,尤其是在推理任务方面。Qwen3 VL 4B 在其通用知识能力和处理困难推理挑战方面的表现之间存在显著差距。

  7. SIGNIFICANT · CL_187043 ·

    Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美

    Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…

  8. TOOL · CL_184660 ·

    Nova Premier:速度快但推理能力弱

    Nova Premier 模型展示了令人印象深刻的速度,每秒可处理 67.6 个 token。然而,其推理能力明显较弱,在 Humanity's Last Exam 基准测试中仅获得 4.7% 的分数。这凸显了人工智能发展中常见的权衡,即原始处理速度并不一定与高级认知能力相关。

  9. TOOL · CL_176863 ·

    Llama 3.1 Tulu3 405B 在推理基准测试中表现出性能差距

    Llama 3.1 Tulu3 405B 模型在基准测试中表现出显著的性能差异,在 MMLU-Pro 上达到 71.6%,而在 Humanity's Last Exam 上仅获得 3.5%。这一巨大差距凸显了即使是先进的开源模型在处理复杂推理任务方面仍然面临挑战。

  10. FRONTIER RELEASE · CL_175302 ·

    Thinking Machines 发布 Inkling-Small,性能超越更大模型

    Thinking Machines Lab 推出了 Inkling-Small,这是一款新的开源多模态模型,它优先考虑效率而非单纯的规模。尽管比其前身 Inkling 体积小得多,Inkling-Small 在各种编码和推理基准测试中表现出卓越的性能。该模型设计用于更轻松的部署,能够在一台 GPU 上运行,并根据 Apache 2.0 许可证提供。

  11. TOOL · CL_174094 ·

    研究发现 HLE 基准衡量的是一般推理能力,而非区分性的 LLM 能力

    一项对 Humanity's Last Exam (HLE) 基准进行的分析新研究发现,其包含 428 道题的多选题子集主要衡量一个单一的一般推理因素,而非区分性的学科领域能力。研究人员应用了心理测量学方法,包括一个 IRT 模型,来评估 29 个大型语言模型。研究结果表明,领域标签仅解释了极少量的方差,并且领域特定的能力估计与总分高度冗余。此外,该基准的测量精度集中在中等能力水平,限制了其有效区分最先进模型的能力。

  12. COMMENTARY · CL_172646 ·

    2026 LLM基准测试:没有赢家,专业化领导者涌现 · 跟踪1个来源

    对2026年20个领先LLM的全面基准测试显示,没有单一的占主导地位的模型,而是出现了跨不同任务的专业化领导者。Claude Opus 5在整体人工智能分析智能指数中领先,而特定模型在编码、代理工具使用、推理和价值方面表现出色。报告强调了成本效益日益增长的重要性,中国的开放权重模型以一小部分价格提供了具有竞争力的性能。它还提醒读者注意基准测试的素养,指出经典的评估已饱和,需要在一致的条件和工具使用下比较模型。

  13. SIGNIFICANT · CL_162426 ·

    Anthropic 的 Claude Opus 5 在生物/网络任务中表现出色,绕过了 Fable 5 的限制

    Anthropic 发布了 Claude Opus 5,将其定位为计算生物学和网络安全任务的强大工具。虽然“前沿”模型 Fable 5 在这些领域受到严格限制,Mythos 5 则仅对特定合作伙伴开放,但 Opus 5 提供了一种平衡的方法。它允许发现源代码漏洞,并在中短期生物任务中表现出色,在 Humanity's Last Exam 和 BrowseComp 等基准测试中取得高分。然而,Opus 5 在长期生物设计任务中可能会遇到…

  14. COMMENTARY · CL_162302 ·

    Anthropic 的新 Opus 模型在关键 AI 基准测试中超越 Fable 5

    据报道,Anthropic 发布了一个新的 Opus 系列模型,该模型在 Humanity's Last Exam、agentic coding 和 ARC-AGI 等基准测试中表现优于其之前的 Fable 5 模型。这一进展表明 Anthropic 的 AI 能力取得了重大进步。用户对实现通用人工智能 (AGI) 的潜力表示乐观,并指出其他前沿模型,如 DeepMind 的 Gemini 3.1 Pro,以及即将发布的 GPT-6、…

  15. RESEARCH · CL_161409 ·

    LLM基准测试结果揭示多个模型的性能 · 追踪9个来源

    一项最近的独立基准评估揭示了包括Kimi K2、Sarvam Maya、NVIDIA Nemotron 3 Super 120B、DeepSeek V3.2、Falcon H1R-7B、GLM-5.2、GLM-5.1、Solar Open 100B和GLM-4.7-Flash在内的多个大型语言模型的性能指标。基准测试涵盖了推理、MMLU-Pro、人类最后考试和长上下文推理等领域,不同模型的结果差异显著。值得注意的是,GLM-5.2和D…

  16. TOOL · CL_153491 ·

    开发者构建测试人类 vs. AI 在专家级考试中的表现

    一位开发者创建了一个名为“人类 vs. 人类最后的考试”的网页测验,让玩家与先进的 AI 模型在具有挑战性的学术问题上进行较量。该测验使用了“人类最后的考试”数据集,并在 Cloudflare Workers 上运行,采用加密和服务器端验证来防止作弊。玩家分数使用 Cloudflare Durable Objects 在排行榜上进行跟踪,开发过程本身使用一种名为 Entire 的工具进行了记录。

  17. RESEARCH · CL_152721 ·

    DBRX Instruct 和 Mistral Medium 3 的基准测试结果公布

    独立基准测试揭示了两款大型语言模型的性能指标。DBRX Instruct 在 GPQA 上获得 33.1% 的分数,在 MMLU-Pro 上获得 39.7%,在 Humanity's Last Exam 上获得 6.6%,在 LiveCodeBench 上获得 9.3%。Mistral Medium 3 表现出更高的性能,在 GPQA 上获得 57.8% 的分数,在 MMLU-Pro 上获得 76%,在 Humanity's Last…

  18. RESEARCH · CL_153696 ·

    新的AI代理处理深度研究和误导性网络数据 · 跟踪4个来源

    研究人员推出了一系列新的递归自改进代理AREX,用于深度研究任务。AREX在研究和自我改进循环之间交替进行,使用自主上下文更新工具来管理不断增长的交互历史。这种方法使AREX在BrowseComp和Humanity's Last Exam等基准测试中表现优于同等规模的基线。同时,另一项研究引入了DRNOISE,这是一个旨在评估深度研究代理在开放网络上处理误导性信息的能力的基准,突出了存在此类文件时准确性显著下降的问题。

  19. SIGNIFICANT · CL_149118 ·

    Mira Murati 的 Thinking Machines 发布开源 Inkling 模型

    由前 OpenAI 高管 Mira Murati 联合创立的 Thinking Machines 发布了其首个模型 Inkling。与许多前沿模型不同,Inkling 的目标并非在排行榜上名列前茅,在 SWE-bench 和 GPQA Diamond 等基准测试中的得分低于 Claude Fable-5 等模型。这个拥有 9750 亿参数的多模态模型是特意设计用于微调的,并已根据宽松的 Apache 2.0 许可证发布,允许用户自由地…

  20. RESEARCH · CL_137517 ·

    开源大模型在多项指标上表现强劲 · 追踪 4 个来源

    根据独立测量结果,几款开源人工智能模型在各种基准测试中表现强劲。Mi:dm K 2.5 Pro 在 GPQA 上达到 70.1%,在 MMLU-Pro 上达到 80.9%;MiMo-V2-Flash 在 GPQA 上达到 83.5%,在 Humanity's Last Exam 上达到 20%;Qwen3.5 122B A10B 在 GPQA 上达到 85.7%,在 Humanity's Last Exam 上达到 23.4%;Apr…