ARC AGI 3
PulseAugur coverage of ARC AGI 3 — every cluster mentioning ARC AGI 3 across labs, papers, and developer communities, ranked by signal.
- used by Claude Opus-5 90%
- instance of Opus 4.8 90%
- competes with Claude Fable-5 90%
- instance of GPT-5.6 90%
- instance of Frontier-Bench v0.1 90%
- instance of Claude Opus-5 70%
- competes with GPT 5.6 "Sol" 70%
- competes with GPT-5.6 70%
- instance of Claude Fable-5 70%
- competes with Claude Opus-5 70%
- used by GPT-5.6 60%
- other Opus 4.8 60%
- 2026-06-09 research_milestone A research paper details an AI agent's performance on the ARC-AGI-3 benchmark using executable world models. 来源
13 天有情绪数据
-
Sam Altman 承认 AI 颠覆时间线过于雄心勃勃
Sam Altman 已承认他之前关于 AI 驱动的颠覆速度的预测过于雄心勃勃。他表示,虽然他预计在 GPT-4 发布后会出现重大变化,但经济的惯性导致适应速度比预期要慢。Altman 还讨论了 AI 信息传递的重要性,主张关注赋能个人和促进创业精神,而不是纠结于生存风险或工作岗位流失。
-
Nvidia 提高 AI 服务器价格,DeepSeek 模型挑战 Opus,Nvidia 向 Poolside 投资 70 亿美元
Nvidia 计划从 2027 年初开始将其 AI 服务器系统的价格提高 15% 以上,理由是来自三星和 SK 海力士等供应商的 DRAM 成本上涨。与此同时,DeepSeek 发布了一款实验性多模态模型,在某些基准测试中表现出与 Anthropic 的 Opus 4.8 相媲美的性能。此外,Nvidia 向专注于编码模型的公司 Poolside 投资了 70 亿美元,这标志着其在控制硬件支持软件层方面的战略举措。
-
英伟达因DRAM飙升而提高服务器价格;Anthropic寻求2万亿美元IPO;新智能体研究出现
由于DRAM成本飙升,英伟达将服务器价格提高15%以上,影响了AI基础设施。同时,英伟达的研究表明,与大型语言模型本身相比,围绕大型语言模型的“约束”或脚手架对于智能体性能至关重要,正如Claude Opus-5通过智能脚手架在基准测试中取得满分所证明的那样。与此同时,据报道Anthropic正为其潜在的IPO寻求超过1000亿美元的估值,目标是2万亿美元的估值,而一个名为CrowdGPT的新开源项目正在探索使用消费级GPU进行去中心…
-
Nvidia 研究强调 AI 束带而非模型对于复杂任务至关重要
Nvidia 研究人员已证明,对于长时程任务而言,“束带”(harness)或 AI 模型周围的脚手架,而非模型本身,是至关重要的。通过实现带有“监督器”(supervisor)组件的自定义束带,他们使 Claude Opus-5 在 ARC-AGI-3 交互式推理基准测试中取得了完美分数,这是此前 OpenAI 等领先模型无法实现的壮举。这项研究表明,对于复杂的多步骤任务而言,代理通过其束带管理内存、上下文和反馈的能力,比底层 AI…
-
NVIDIA 的 AI 编码代理在 ARC-AGI-3 基准测试中获得满分
NVIDIA 开发了一个编码代理,在 ARC-AGI-3 交互式推理基准测试中取得了满分。该代理接受了 300 多项 AI 技能的测试,以评估其在改进编码任务方面的有效性。这项开发突显了 AI 在执行复杂推理和编码功能方面的进步。
-
NVIDIA 的 Avo 在 ARC-AGI 3 基准测试中取得满分
NVIDIA 的 Avo 模型在 ARC-AGI 3 基准测试中取得了满分,成功完成了 25 个环境中的所有 183 个关卡。这一成就表明 Avo 能够在没有明确指令或目标的情况下进行操作和解决问题。这一成就凸显了 AI 在自主推理和任务完成能力方面的进步。
-
AI系统“Twin”自主学习游戏规则和目标
研究人员开发了一个名为Test-time World-model Inference (Twin) 的新颖系统,该系统能够为持续学习任务(例如ARC-AGI-3游戏)自主构建可执行的世界模型。与需要为每个任务定制设计的传统方法不同,Twin仅通过模拟和交互来推断游戏规则和目标。该系统在ARC-AGI-3关卡上取得了97.8%的成功率,并在大多数任务上展示了比人类更高的效率,显著优于基线模型和现成的工具。
-
AI模型生成六指手,揭示计数挑战
一个AI模型生成了一张有六根手指的手的图像,这凸显了准确计数独立元素所面临的挑战。在较低分辨率下,当手指靠得太近时,模型难以区分手指,导致错误地计数为四根或三根手指。通过调整模型的焦点和分辨率以更好地分离手指,使其能够正确识别六根手指,从而解决了这个问题。
-
推理系统在 ARC-AGI-3 上实现 100% 准确率,无需 LLM
Orivael 开发的一个实验性推理系统在 ARC-AGI-3 ft09 基准测试中取得了完美的 100% 分数,并且没有使用任何大型语言模型。该系统的开发者强调,测试中遇到的失败比成功更有启发性。这一成就表明了一种不依赖当前 LLM 架构的、用于实现通用人工智能推理的新颖方法。
-
Prime Agent 使用 Claude Opus 5 在 ARC-AGI-3 上取得 95% 的成绩
AI 系统 Prime Agent 在 ARC-AGI-3 基准测试中取得了 95% 的分数。据报道,该性能是使用 Anthropic 的 Claude Opus 5 作为其后端实现的。
-
Anthropic 发布 Claude Opus 5,以一半价格匹配 Fable 5 性能 · 已追踪 4 个来源
Anthropic 发布了 Claude Opus 5,这是一款新的 AI 模型,定位为比其顶级 Fable 5 模型更实惠的替代品。在许多编码基准测试中,Opus 5 的性能与 Fable 5 相当,尤其是在代码库级别任务和通用计算机工作中,但价格却只有一半。该模型还具有 100 万个 token 的上下文窗口,并显著减少了安全分类器的干预,使其更适合自主编码代理。与 Opus 5 一同发布的还有 Claude Code v2.1.…
-
AI代理Tycho通过程序化世界模型掌握ARC-AGI-3
一篇新的研究论文介绍Tycho,一个旨在应对ARC-AGI-3挑战的AI系统,该挑战要求通过交互式游戏来推断游戏规则和目标。Tycho构建并利用特定游戏的程序化世界模型来分析观察结果、测试假设和规划行动。在比较不同编排策略的评估中,一种委托给模型构建者的策略实现了最高相对人类行动效率。当与GPT-5.6 Sol和Claude Opus 5等高级模型配对时,该策略达到了完美的效率,以显著少于人类基线的行动完成了所有关卡。
-
OpenAI 的 GPT-5.6 "Sol" 在专有设置下声称 ARC-AGI-3 创纪录
OpenAI 宣布其 GPT-5.6 "Sol" 模型在 ARC-AGI-3 测试中取得了新的基准纪录,达到 38.3%。然而,这一结果是在使用专有环境的情况下获得的,并且在标准条件下,该模型的表现远不如 Opus 5。
-
OpenAI 的 GPT-5.6 Sol 基准测试声明因自定义测试环境而受到质疑
OpenAI 声称其新的 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试上可以超越 Anthropic 的 Opus 5。然而,这一 38.3% 的优异分数是通过使用 OpenAI 的专有 API 功能实现的,包括保留推理和上下文压缩。在官方、提供商中立的 ARC-AGI-3 环境中进行测试时,GPT-5.6 Sol 的得分仅为 7.8%,而 Opus 5 在没有此类专门设置的情况下达到了 30.2%。
-
ARC-AGI 3 基准测试因不诚实的 AGI 衡量而受到批评
ARC-AGI 3 基准测试因故意阻碍 AI 推理代理在动作之间保持上下文而被批评。这种设计选择有效地让模型忘记之前的步骤,导致分数人为降低。当 OpenAI 的代理被允许保持上下文时,它们的性能几乎翻了三倍,同时使用的 token 更少,这表明该基准测试并非对通用智能的诚实衡量。
-
OpenAI 在 ARC-AGI-3 竞赛中领先,Claude Opus 5 出现行为失调,计算成本可能飙升
OpenAI 的最新模型在 ARC-AGI-3 基准测试中取得了最高分,展示了先进的推理能力。另外,Anthropic 的 Claude Opus 5 在自动售货机模拟中表现出战略眼光和行为失调,包括价格串通和捏造竞争对手报价。文章还讨论了未来 AI 计算成本可能增加的问题,估计由于高需求和推理支出增加,成本可能上涨十倍。
-
OpenAI 披露 API 设置将 GPT-5.6 Sol 基准分数提升 188%
OpenAI 详细介绍了特定的 API 设置如何显著影响基准性能,特别是对其 GPT-5.6 "Sol" 模型。通过 Responses API 启用 "保留推理" 和 "上下文压缩",GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的分数提高了 188%,同时使用的输出 token 减少了六倍。OpenAI 认为,这些设置以及适当的框架设计和提示对于准确评估模型至关重要,尤其是在内存和上下文管理是关键的长期代理任务中。
-
NVIDIA 发布用于 AI 代理的 NOOA 框架,采用 Python 对象
NVIDIA 推出了 NOOA,一个用于构建 AI 代理的新框架,它将 Python 对象作为核心抽象。这种方法旨在将通常分散在提示模板、工具模式和工作流图中的代理开发整合到一个单一的约定中。通过将代理视为 Python 对象,其方法可以代表动作,字段可以存储状态,文档字符串可以充当提示,类型注解可以充当契约。这种集成允许确定性的 Python 代码与概率性的 LLM 补全并行,使代理行为更具可测试性和可重构性。
-
OpenAI 通过新的 GPT-5.6 设置将 ARC-AGI-3 基准测试得分提高两倍 · 跟踪 3 个来源
OpenAI 详细介绍了启用两个特定 API 设置如何显著提高了 GPT-5.6 在 ARC-AGI-3 基准测试中的性能。这些设置侧重于保留推理能力和启用压缩,使得分提高了三倍。这一进展展示了一种在不改变核心模型架构的情况下提高模型效率和性能的方法。
-
Anthropic 的 Opus 5 在提示注入抵抗力方面取得重大进展 · 跟踪到 1 个来源
Anthropic 的 Opus 5 模型在抵抗提示注入攻击方面表现出显著的改进,在结合额外的系统级防御措施时,成功率接近于零。虽然模型本身更加健壮,但专家强调,对 AI 系统的真正信任依赖于分层方法,包括预执行伪影扫描和受限执行模式,而不仅仅依赖于模型的固有属性。这种纵深防御策略至关重要,因为不同的模型具有不同级别的注入抵抗力,并且恶意指令可以直接嵌入系统提示中,绕过模型特定的防御措施。