Humanity's Last Exam
PulseAugur coverage of Humanity's Last Exam — every cluster mentioning Humanity's Last Exam across labs, papers, and developer communities, ranked by signal.
- instance of Claude Opus-5 90%
- instance of Deep Research 90%
- instance of MMLU-Pro 70%
- instance of SciCode 70%
- competes with Claude Opus-5 70%
- competes with Claude Fable-5 70%
- competes with GPT 5.6 "Sol" 70%
- instance of GPQA Diamond 70%
- instance of ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems 70%
- instance of BrowseComp+ 70%
- instance of DeepSearchQA 70%
- instance of long-context reasoning 60%
8 天有情绪数据
-
OpenAI 发布 GPT-6 并推出交互式 UI;Anthropic 大幅降低 Haiku 成本
OpenAI 发布了 GPT-6,该模型具有“智能 UI”,可将交互式元素直接集成到聊天界面中,将其转变为应用程序生成器。与此同时,Anthropic 已大幅降低其 Claude Haiku 5.5 模型的成本,使其比前代产品便宜 75%,并与 OpenAI 的 GPT-6 Luna 定价持平。OpenAI 还报告称,一个 AI 代理生成了 372 个数学结果的突破,这比以前的群集方法更有效。然而,对 AI 安全的担忧依然存在,一份报…
-
DeepSeek V4 Flash 0420 取得强劲基准分数
DeepSeek V4 Flash 0420 (Max) 在多项基准测试中取得了显著分数,包括 GPQA 的 89.4% 和 SciCode 的 45.3%。该模型在长上下文推理方面也表现出色,得分为 74.3%。这些结果使 DeepSeek V4 Flash 0420 成为开源 AI 领域中的有力竞争者,每美元拥有 144 智能点。
-
Hugging Face 排行榜:基准测试如何被填充和查看
Hugging Face 维护着 48 个官方基准测试的排行榜,这些排行榜通过模型仓库中的 .eval_results YAML 文件由模型作者提交结果来填充。这些排行榜由 Hugging Face 自动组装,并非由基准测试所有者直接上传。大约 30% 的条目在默认视图中不可见,需要进行特定过滤。 “Agents and terminal”类别包含的基准测试最多,而 “Science and knowledge”类别包含的条目最多,其…
-
DeepSeek V4 Pro 0813 基准测试显示 Humanity's Last Exam 得分为 10.6%
DeepSeek V4 Pro 0813 在包括 Humanity's Last Exam、Long Context Reasoning 和 SciCode 在内的基准测试中展示了具体的性能指标。该模型在 Humanity's Last Exam 上达到 10.6%,在 Long Context Reasoning 上达到 50.7%,在 SciCode 上达到 39.9%。此外,它每秒处理 160.7 个 token,每美元达到 1…
-
DeepSeek V4 Pro 和 Nova 2.0 Lite 基准测试公布 · 跟踪 2 个来源
独立基准测试揭示了两个大型语言模型 DeepSeek V4 Pro 和 Nova 2.0 Lite 的性能。DeepSeek V4 Pro 在侧重推理的任务中取得了高分,GPQA 得分为 92.8%,长上下文推理得分为 80.3%。Nova 2.0 Lite 被描述为非推理模型,在这些基准测试中的得分较低,但提供了更高的每美元智能点数指标。
-
GPT-6 Astra 与 Claude Fable 5.1 在基准测试中对决
OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Fable 5.1 的直接比较揭示了每个先进 AI 模型各自的优势。GPT-6 Astra 凭借其 1.1M 的上下文窗口在处理海量代码库方面表现出色,并在形式数学推理方面展现出卓越的性能,在 FrontierMath 上取得了 97.6% 的得分。另一方面,Claude Fable 5.1 在细致的系统提示遵循和复杂的多角色编排方面处于领先地位,在 …
-
MiniMax M1 40k 在现实世界推理基准测试中表现不佳
对 MiniMax M1 40k 模型进行的独立基准测试评估显示,其性能显著下降,在 Humanity's Last Exam 上的得分仅为 7.8%。这一结果凸显了在大型语言模型中实现强大现实世界推理能力所面临的持续挑战。
-
Google 和 Meta 发布新的专注于编码的 AI 模型
Google 和 Meta 分别发布了新的专注于编码的 AI 模型 Gemini 3.8 Flash 和 Muse Spark 1.3。这些模型旨在以低于旗舰模型的价格,处理大批量编码和代理任务。Gemini 3.8 Flash 在软件工程和命令行任务上表现强劲,而 Muse Spark 1.3 在银行和终端操作方面有了显著改进,但它仍然是一个专有的仅限 API 的模型。
-
AI监督器在获得答案后得到改进,但推理验证仍薄弱
一篇题为“答案并非论证”的新研究论文探讨了思维链监控对于AI监督的有效性。研究发现,为AI监督器提供可信的参考答案,可以显著提高它们检测错误的能力,尤其是在识别不正确的最终输出方面。然而,这种对答案的访问并未实质性地提高监督器验证推理过程本身健全性的能力,特别是当最终答案正确但底层逻辑存在缺陷时。研究结果表明,当前的评估方法可能高估了AI监督能力,因为可接受的输出可能会掩盖不健全的推理,这种现象类似于AI安全中的奖励攻击。
-
Anthropic推出Claude Fable 5.1,编码能力提升,成本降低 · 追踪10个来源
Anthropic发布了其最新的AI模型Claude Fable 5.1和Mythos 5.1,在编码和科学研究方面提供了改进的性能。Fable 5.1是通用版本,在Terminal-Bench-Science等基准测试中取得了显著的进步,并以其增强的编码能力而闻名。这两个模型都拥有100万个token的上下文窗口,并大幅降低了缓存数据的成本,使得复杂、代理任务的成本最高可降低45%。Mythos 5.1仅限于经过审查的组织用于特定的…
-
Anthropic 的 Claude Fable 5.1 发布,基准测试有所提升,成本引发争议 · 已追踪 10 个来源
Anthropic 发布了其新一代 AI 模型 Claude Fable 5.1,现已在 Cursor 和 Perplexity 等平台上可用。此次发布在基准测试方面取得了显著进步,尤其是在智能体任务和减少对良性查询的拒绝方面。然而,定价结构仍然是讨论的焦点,实际成本因缓存命中率和工作负载类型而异,引发了关于其是否物有所值(与 Opus 5 相比价格翻倍)的争论。
-
LLM基准测试结果:Molmo、Qwen3、Hermes和Mistral性能揭晓
独立基准测试揭示了多个大型语言模型在不同任务上的表现。Molmo 7B-D在GPQA和MMLU-Pro上得分较低,而Qwen3 Omni 30B A3B和Hermes 4 - Llama-3.1 405B在推理任务上展现出显著更强的能力。Mistral Medium 3在长上下文推理方面也表现强劲。
-
研究表明,多智能体系统中的LLM评判面临可靠性问题
多篇研究论文探讨了在多智能体系统和评估智能体工具调用中使用大型语言模型(LLM)作为评判者的局限性和潜在改进。一项研究引入了AgentAuditor,它使用推理树来比多数投票更有效地聚合智能体输出,并引入了Anti-Consensus Preference Optimization来减少从众偏见。另一篇论文《LLM作为评判者并非神谕》(LLM-as-a-Judge Is Not an Oracle)强调了在使用LLM评判者的自改进智能…
-
新的Qworld方法生成特定问题的LLM评估标准
研究人员推出了一种新颖的大型语言模型(LLM)评估方法Qworld,通过生成特定于问题的标准来进行评估。该方法通过为每个单独的问题创建详细的、上下文感知的评估标准,解决了静态评分标准存在的局限性。Qworld将问题分解为场景、视角和细粒度标准,揭示了LLM在长期影响和跨学科推理等领域的能力差异,而这些差异往往会被更广泛的指标所忽略。
-
新的 HLE-Verified 基准修正了 Humanity's Last Exam 中的错误
研究人员开发了 HLE-Verified,这是 Humanity's Last Exam (HLE) 基准的一个修订版本,旨在解决有关噪声数据和有偏评估的担忧。新基准采用两阶段验证和修复过程,包括专家审查和基于模型的交叉检查,以确保准确性。在测试最先进的语言模型时,HLE-Verified 显示平均准确率提高了 7-10 个百分点,在包含原始问题陈述或答案错误的条目上有了显著改进。
-
Sarvam 30B 模型性能指标在基准测试中公布
Sarvam AI 发布了其 Sarvam 30B 模型,目前已公布多个基准测试的性能指标。该模型在 GPQA 上达到 63.3%,在 Humanity's Last Exam 上达到 7.5%,在 SciCode 上达到 19.2%。值得注意的是,它在长上下文推理任务上得分为 0%,并且其成本效益以每美元 136.2 智能点突出显示。
-
Llama、GLM 和 Mistral 模型发布 LLM 性能基准 · 跟踪 4 个来源
独立基准测试揭示了包括 Llama 3.2 Instruct 90B、GLM-4.7-Flash、Mistral Large 2 和 Llama 3.1 Instruct 8B 在内的多个大型语言模型的性能指标。数据突出了 GPQA、MMLU-Pro、Humanity's Last Exam 和 Long Context Reasoning 等各种评估的分数,一些模型还报告了每美元的智能点数。
-
OpenAI 发布 GPT-5.6 Sol,推出速度提升 14 倍的“超快模式” · 跟踪 2 个来源
OpenAI 为其 GPT-5.6 Sol 模型推出“超快模式”,速度比之前版本快高达 14 倍。这项通过 OpenAI API 提供并由 Cerebras 提供支持的新服务级别,每秒可输出高达 750 个 token。基准测试显示,超快模式下的 GPT-5.6 Sol 在速度上显著优于 Claude Fable-5 和 Opus 4.8 等模型,尤其是在 Humanity's Last Exam 等具有挑战性的基准测试中,同时保持了…
-
LLM 基准测试显示 Kimi、Qwen3 和 Exaone 模型结果不一
独立基准测试揭示了几款大型语言模型在性能上的差异。Kimi K2 0905 在 GPQA 和 MMLU-Pro 上取得了高分,而 Qwen3 235B A22B 在这些指标上也表现良好,但在长上下文推理方面遇到困难。Exaone 4.0 在各项测试中得分较低,尤其是在推理任务方面。Qwen3 VL 4B 在其通用知识能力和处理困难推理挑战方面的表现之间存在显著差距。
-
Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美
Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…