PulseAugur
实时 06:58:15
实体 Agents Last Exam

Agents Last Exam

PulseAugur coverage of Agents Last Exam — every cluster mentioning Agents Last Exam across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-11 research_milestone GPT-5.5 outperformed Claude Fable 5 on the new Agents Last Exam benchmark. 来源
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 13 条
  1. FRONTIER RELEASE · CL_234775 ·

    OpenAI 发布 GPT-6 Astra,声称在各项基准测试中达到新的最先进水平 · 跟踪 6 个来源

    OpenAI 发布了其最新的最先进模型 GPT-6 Astra。该公司声称 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 等一系列基准测试中表现出色,在科学发现和专业任务方面取得了显著进展。OpenAI 还强调了 Astra 在用户意图对齐和理解方面的改进,将其定位为世界上最智能、最对齐且能够执行计算机任务的模型。

  2. SIGNIFICANT · CL_230221 ·

    DeepSeek V4 多模态模型权重已发布供检查

    DeepSeek 发布了其 V4 多模态模型的权重和参考代码,允许研究人员检查其视觉处理能力。与简单的图像到文本的附加功能不同,V4 将视觉 token 直接集成到其现有架构中,使其能够参与注意力机制、专家混合(MoE)路由和代理推理。该模型采用 Vision Transformer (ViT) 进行初始编码,然后使用 Aligner 将视觉特征压缩并映射到语言模型的空间中。V4 内的专用机制处理视觉 token,包括修改后的注意力规…

  3. SIGNIFICANT · CL_210098 ·

    Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜

    阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。

  4. SIGNIFICANT · CL_203047 ·

    OpenAI 的 GPT-5.6 Sol 在代码生成方面表现出色,但在数据库填充方面遇到困难

    OpenAI 发布了 GPT-5.6 Sol,该模型在编码任务和令牌效率方面取得了显著进步,在基准测试中优于 Claude Opus 4.8 等先前模型。然而,该模型在填充数据库方面遇到困难,这项任务需要对给定模式的特定知识,而这些知识在其通用训练数据中并不存在。这一限制成为瓶颈,因为由于模型无法了解或创建必要的父行,其生成的代码在与真实数据库约束交互时经常失败。

  5. TOOL · CL_153338 ·

    AI Agents Last Exam 排行榜将于2月前达到饱和

    Agents Last Exam 排行榜已接近饱和,目前的基准测试表明,它最迟将于明年2月达到完全饱和。该排行榜跟踪AI代理在各种任务上的表现,衡量通过率(100%得分的任务比例)和所有任务的平均得分。数据显示代理能力正在快速发展,导致了预期的饱和点。

  6. SIGNIFICANT · CL_143284 ·

    GPT 5.6-Sol 在代理任务上优于 Claude Fable-5,但仍存疑问

    据报道,一款新模型 GPT 5.6-Sol 在长时序代理任务上超越了 Anthropic 的 Claude Fable-5,在 Agents' Last Exam 上的得分分别为 53.6 和 40.5。尽管在性能和价格上占有优势,但一些评论者认为 Fable-5 在架构推理和规划方面可能仍然表现出色。OpenAI 未发布 GPT 5.6-Sol 的长上下文回忆数字的决定也引发了疑问,特别是考虑到 Grok 和 Google 等其他主…

  7. FRONTIER RELEASE · CL_131213 ·

    OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra 和 Luna

    OpenAI 推出了其新的 GPT-5.6 模型系列,包含三个层级:Sol(旗舰)、Terra(平衡)和 Luna(最快且最便宜)。这些模型提供不同的价格性能点,Sol 在编码和代理工作等复杂任务中最具能力,而 Terra 和 Luna 为通用用途提供了更具成本效益的选择。此次发布还包括新的 API 功能,如程序化工具调用和多代理功能,旨在提高各种应用的效率和可负担性。

  8. RESEARCH · CL_115429 ·

    Meta AI 聘请 AI 安全专家 Jianfeng Gao 领导 Superintelligence Labs

    Meta AI 聘请了 Yann LeCun 博士的前同事 Jianfeng Gao 博士来领导其 Superintelligence Labs。Gao 博士此前是加州大学伯克利分校的教授,也是 Virtue AI 的联合创始人,他将专注于 Meta 的 AI 安全和保障工作。他认为,能够提供经济价值的 AI 代理代表了 AI 发展的下一个前沿领域,并引用了一个新的基准测试 Agents' Last Exam,该测试旨在评估 AI 代…

  9. TOOL · CL_87018 ·

    新基准显示 GPT 5.5 在真实世界任务中超越 Claude Fable 5

    一项由加州大学伯克利分校等机构研究人员开发的新基准测试“智能体最后的考试”(ALE)揭示了 AI 智能体性能方面令人惊讶的结果。在最具挑战性的任务中,Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT 5.5 等领先模型得分均为零,表明在处理复杂、真实世界任务方面存在显著局限性。在稍具挑战性的任务上进行测试时,GPT 5.5 的表现优于 Claude Fable 5,这与之前的基准测试结果有所不同。

  10. RESEARCH · CL_85769 ·

    GPT-5.5 在新的 AI Agent 基准测试中超越 Claude Fable 5

    据报道,OpenAI 的 GPT-5.5 在新的 Agents' Last Exam (ALE) 基准测试中超越了 Anthropic 的 Claude Fable 5。该基准测试由加州大学伯克利分校开发,评估 AI Agent 自主执行复杂、多步骤任务的能力。在具有挑战性的测试中,GPT-5.5 的得分是 94%,而 Claude Fable 5 的得分为 86%。

  11. SIGNIFICANT · CL_85182 ·

    GPT-5.5 在新的 AI Agent 基准测试中超越 Claude Fable 5

    OpenAI 的 GPT-5.5 在一个名为 Agents Last Exam (ALE) 的新 AI 基准测试中,性能优于 Anthropic 的 Claude Fable 5。该基准测试由伯克利 RDI 联合 300 多名专家开发,用于测试自主 AI Agent。这一结果令人惊讶,因为 Claude Fable 5 此前被认为是此类任务的领先模型。

  12. TOOL · CL_72654 ·

    新基准测试AI代理在现实经济任务中的表现

    一项名为Agents' Last Exam (ALE) 的新基准测试已被推出,用于评估AI代理在现实世界专业领域中的长期、具有经济价值的任务。ALE由250多名行业专家开发,涵盖非实体行业,包含13个行业集群中的1000多个任务。目前的结果表明,即使是先进的AI代理在这些复杂任务上也表现不佳,平均完全通过率仅为2.6%。该基准测试旨在成为一个动态工具,不断扩展其任务池,以弥合AI在基准测试中的表现与其实际经济影响之间的差距。

  13. TOOL · CL_81353 ·

    新基准显示 AI 代理仅能完成 2.6% 的真实世界任务

    一项名为 Agents' Last Exam (ALE) 的新基准被引入,用于评估 AI 代理在与专业行业相关的复杂真实世界任务上的表现。ALE 由 250 多名行业专家开发,涵盖 13 个行业集群中的 1000 多个任务,这些任务源自实际专家项目,并利用了美国联邦职业分类法。初步结果表明,当前 AI 代理在最具挑战性的层级上仅达到 2.6% 的通过率,这凸显了 AI 能力与实际工作场所自动化之间存在的巨大差距。