Agents Last Exam
PulseAugur coverage of Agents Last Exam — every cluster mentioning Agents Last Exam across labs, papers, and developer communities, ranked by signal.
- 2026-06-11 research_milestone GPT-5.5 outperformed Claude Fable 5 on the new Agents Last Exam benchmark. 来源
4 天有情绪数据
-
AI Agents Last Exam 排行榜将于2月前达到饱和
Agents Last Exam 排行榜已接近饱和,目前的基准测试表明,它最迟将于明年2月达到完全饱和。该排行榜跟踪AI代理在各种任务上的表现,衡量通过率(100%得分的任务比例)和所有任务的平均得分。数据显示代理能力正在快速发展,导致了预期的饱和点。
-
GPT 5.6-Sol 在代理任务上优于 Claude Fable-5,但仍存疑问
据报道,一款新模型 GPT 5.6-Sol 在长时序代理任务上超越了 Anthropic 的 Claude Fable-5,在 Agents' Last Exam 上的得分分别为 53.6 和 40.5。尽管在性能和价格上占有优势,但一些评论者认为 Fable-5 在架构推理和规划方面可能仍然表现出色。OpenAI 未发布 GPT 5.6-Sol 的长上下文回忆数字的决定也引发了疑问,特别是考虑到 Grok 和 Google 等其他主…
-
OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra 和 Luna
OpenAI 推出了其新的 GPT-5.6 模型系列,包含三个层级:Sol(旗舰)、Terra(平衡)和 Luna(最快且最便宜)。这些模型提供不同的价格性能点,Sol 在编码和代理工作等复杂任务中最具能力,而 Terra 和 Luna 为通用用途提供了更具成本效益的选择。此次发布还包括新的 API 功能,如程序化工具调用和多代理功能,旨在提高各种应用的效率和可负担性。
-
Meta AI 聘请 AI 安全专家 Jianfeng Gao 领导 Superintelligence Labs
Meta AI 聘请了 Yann LeCun 博士的前同事 Jianfeng Gao 博士来领导其 Superintelligence Labs。Gao 博士此前是加州大学伯克利分校的教授,也是 Virtue AI 的联合创始人,他将专注于 Meta 的 AI 安全和保障工作。他认为,能够提供经济价值的 AI 代理代表了 AI 发展的下一个前沿领域,并引用了一个新的基准测试 Agents' Last Exam,该测试旨在评估 AI 代…
-
新基准显示 GPT 5.5 在真实世界任务中超越 Claude Fable 5
一项由加州大学伯克利分校等机构研究人员开发的新基准测试“智能体最后的考试”(ALE)揭示了 AI 智能体性能方面令人惊讶的结果。在最具挑战性的任务中,Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT 5.5 等领先模型得分均为零,表明在处理复杂、真实世界任务方面存在显著局限性。在稍具挑战性的任务上进行测试时,GPT 5.5 的表现优于 Claude Fable 5,这与之前的基准测试结果有所不同。
-
GPT-5.5 在新的 AI Agent 基准测试中超越 Claude Fable 5
据报道,OpenAI 的 GPT-5.5 在新的 Agents' Last Exam (ALE) 基准测试中超越了 Anthropic 的 Claude Fable 5。该基准测试由加州大学伯克利分校开发,评估 AI Agent 自主执行复杂、多步骤任务的能力。在具有挑战性的测试中,GPT-5.5 的得分是 94%,而 Claude Fable 5 的得分为 86%。
-
GPT-5.5 在新的 AI Agent 基准测试中超越 Claude Fable 5
OpenAI 的 GPT-5.5 在一个名为 Agents Last Exam (ALE) 的新 AI 基准测试中,性能优于 Anthropic 的 Claude Fable 5。该基准测试由伯克利 RDI 联合 300 多名专家开发,用于测试自主 AI Agent。这一结果令人惊讶,因为 Claude Fable 5 此前被认为是此类任务的领先模型。
-
新基准测试AI代理在现实经济任务中的表现
一项名为Agents' Last Exam (ALE) 的新基准测试已被推出,用于评估AI代理在现实世界专业领域中的长期、具有经济价值的任务。ALE由250多名行业专家开发,涵盖非实体行业,包含13个行业集群中的1000多个任务。目前的结果表明,即使是先进的AI代理在这些复杂任务上也表现不佳,平均完全通过率仅为2.6%。该基准测试旨在成为一个动态工具,不断扩展其任务池,以弥合AI在基准测试中的表现与其实际经济影响之间的差距。
-
新基准显示 AI 代理仅能完成 2.6% 的真实世界任务
一项名为 Agents' Last Exam (ALE) 的新基准被引入,用于评估 AI 代理在与专业行业相关的复杂真实世界任务上的表现。ALE 由 250 多名行业专家开发,涵盖 13 个行业集群中的 1000 多个任务,这些任务源自实际专家项目,并利用了美国联邦职业分类法。初步结果表明,当前 AI 代理在最具挑战性的层级上仅达到 2.6% 的通过率,这凸显了 AI 能力与实际工作场所自动化之间存在的巨大差距。