ARC AGI 3
PulseAugur coverage of ARC AGI 3 — every cluster mentioning ARC AGI 3 across labs, papers, and developer communities, ranked by signal.
- instance of GPT 5.6 "Sol" 90%
- instance of GPT-6 Astra 90%
- instance of Astra 90%
- competes with Claude Fable-5 90%
- instance of Opus 4.8 90%
- instance of ExploitBench 90%
- instance of GPT-5.6 90%
- instance of Frontier-Bench v0.1 90%
- instance of Prime Agents 90%
- instance of FrontierMath Tier 4 90%
- competes with GPT 5.6 "Sol" 70%
- used by Claude Opus-5 70%
- 2026-06-09 research_milestone A research paper details an AI agent's performance on the ARC-AGI-3 benchmark using executable world models. 来源
6 天有情绪数据
-
FreeEvolve系统学会自动进化AI代理
研究人员开发了FreeEvolve,一个新颖的系统,可以自动设计语言模型的代理进化器。与依赖固定、手工设计的搜索循环的现有方法不同,FreeEvolve的进化器学会了关于测试、证据收集和候选者追求的决策。这种学习到的进化技能通过元进化得到进一步提高,其中候选技能根据它们产生的代理的性能进行评分。FreeEvolve在tau3-bench和ARC-AGI-2等基准测试中表现出显著的改进,优于手工设计的进化器,并显示出跨不同环境的可迁移学习。
-
GPT-6 Astra 声称在基准测试中获胜,但 AGI 状态未确认
据报道,一款新的人工智能模型 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了 98.6% 的分数,显著超过了之前 GPT-5.6 "Sol" 模型的 7.8%。尽管取得了如此高的性能,OpenAI 警告不要直接比较,因为评估方法存在差异。虽然 GPT-6 Astra 展现了先进的问题解决能力,并为数学研究提供了帮助,但其推理一致性被认为不稳定,并且实现 AGI 的状态仍未得到确认。
-
AI模型在以人为中心的ARC-AGI-3基准测试中迅速提升 · 跟踪2个来源
旨在展示人类优势的ARC-AGI-3基准测试在Kaggle上的最高分出现了急剧增长。在过去的一个月里,这些分数从7%飙升至56%。这一进步是通过相对较小的、可在本地运行的模型实现的,表明AI在该特定基准测试上的能力有了显著飞跃。
-
Anthropic、OpenAI引领AI竞赛;开源模型缩小差距 · 跟踪1个来源
2026年秋季,AI领域由Anthropic的Claude Opus 5.5和OpenAI的GPT-6 Astra主导,它们在编码、推理和知识基准测试中领先。Moonshot和DeepSeek等实验室的开源模型正在迎头赶上,大约落后三到八个月。对于开发者来说,订阅成本和使用限制正变得比微小的基准分数差异更关键,GPT-6.1 Sol和Sonnet 5.5等模型的定价在中端市场正在崩溃。
-
MIT博士候选人探索递归语言模型和智能体集群
MIT的博士候选人Alex Zhang正在探索递归语言模型(RLM)和先进的智能体系统在释放更强大AI能力方面的潜力。他的研究在Latent Space播客中进行了详细介绍,深入探讨了AI生成的GPU内核、通过组合器实现的组合泛化,以及“语言模型”演变成一个看不见的智能体集群的概念。Zhang的研究还涉及OpenAI的大规模智能体实验,并比较了多智能体系统的不同方法,表明当前的尖端模型可能已经拥有巨大的未开发潜力。
-
Kepler 系统使用 Claude Opus 5 在 ARC-AGI-3 上取得满分
研究人员开发了 Kepler,一个开源系统,旨在创建可审计的世界模型,用于评估 ARC-AGI-3 基准上的 AI 代理。使用 Claude Opus 5 的特定配置,Kepler 在所有公开游戏中实现了 100.00 RHAE 的完美分数,且无需针对每个游戏进行调优。该系统还展示了效率,其最终 Opus 尝试使用的操作与人类基线相当,处理 8.58 亿个 token 的成本为 777.72 美元。该论文还详细介绍了评估失败,包括源代…
-
GPT-6 Sol & Astra 登顶 ARC-AGI-3 基准测试
两个新模型 GPT-6 Sol 和 Astra 登上了 ARC-AGI-3 排行榜的榜首。这些模型在该基准测试中表现出色,为通用人工智能能力树立了新的标杆。它们的架构和训练方法的具体细节尚未广泛公开,但它们的领先地位表明该领域取得了重大进展。
-
开源工具 Corteza 在 ARC-AGI-3 上以 Claude Opus 5 取得 98.6% 的分数
一个名为 Corteza 的开源工具,由 Troy 开发,在 ARC-AGI-3 基准测试中取得了 98.6% 的分数。这一成就的实现是使用了 Claude Opus 5,并完成了 25 个公开游戏中的全部 183 个关卡。Corteza 套件旨在在一个持久的 R 工作空间中编写和重用函数,允许数据和函数在对话压缩过程中持续存在。
-
AGI辩论因新基准和OpenAI的Astra模型而升温
最近的一段视频和相关研究探讨了通用人工智能(AGI)不断演变的定义和潜在实现。讨论将AGI的经济学定义与侧重于技能获取和泛化的框架进行了对比,并提到了OpenAI的最新模型Astra(GPT-6 Astra)。据报道,该模型在FrontierMath和ARC-AGI-3等基准测试中取得了高分,甚至协助解决了长期存在的数学难题。AGI发展的瓶颈似乎已从AI解决问题的速度转移到人类验证循环,强调了普及AI素养的必要性。
-
分析称 OpenAI 的 GPT-6 Astra 在图形方面取得重大进展
Sebastian Raschka 的分析表明,OpenAI 的新 GPT-6 Astra 模型在图形任务方面比前代 GPT-5.6 "Sol" 有显著改进,并在 ARC-AGI-3 基准测试中取得了近乎完美的成绩。虽然 Astra 在数学和编码方面表现出色,但其在代理编码任务上的领先优势不那么明显,这可能归因于基准测试特定的训练。文章还深入探讨了“循环 Transformer”的概念及其与高级 AI 模型中“隐藏推理”的潜在联系。
-
Astra,可能是 GPT-6,在复杂任务中展现潜力,尽管代币使用量大
一款名为 Astra 的新模型,可能是 GPT-6 系列的首款,已经发布,并在图像生成和复杂 3D 世界构建等领域展现出令人印象深刻的能力。虽然一些用户发现它消耗大量代币且不稳定,但另一些用户通过在 Unreal Engine 中重建曼哈顿并自主生成 UI 证明了它的强大。OpenAI 也通过 Astra 实现了其自动化研究实习生的目标,该实习生能够处理多天的研究任务,并计划在 2028 年实现自动化 AI 研究员。
-
GPT-5.6 "Sol" 的 API 设置更改使其性能翻三倍,而非模型更新
OpenAI 已证明,单个模型 GPT-5.6 "Sol",通过调整 API 设置而非更改模型本身,可以在 ARC-AGI-3 基准测试中实现显著的性能提升。通过保留模型的推理能力并压缩历史记录而非丢弃,该模型的分数从 13.3% 提高到 38.3%,同时使用的输出 token 减少了六分之一。这表明之前的基准测试结果可能由于配置选择而被人为降低,这些选择导致模型出现一种“顺行性遗忘”,迫使其逐轮重新推导解决方案。
-
菲尔兹奖得主创立的公司实现AI模型协同,降低成本并提升性能
一家名为Mostik的初创公司,由包括菲尔兹奖得主在内的团队创立,开发了一种改进AI模型协同工作的新颖方法。他们的方法绕过了模型之间传统的基于文本的通信,而是通过一个训练好的“桥梁”直接将大模型的内部状态传输给小模型。这种技术显著降低了计算成本并提升了小模型的性能,使其能够弥合与大模型之间相当大的能力差距。该团队认为,这种方法可以带来更高效的AI系统,并可能减少对单一庞大模型的依赖。
-
AI集成挑战与Agent进展探索 · 追踪1个来源
新研究探讨了将AI集成到现有组织结构中的实际挑战,表明个人生产力提升常常受到遗留层级和决策过程的阻碍。研究结果表明,需要对角色和职责进行根本性重新设计,以实现跨界自主性。此外,像GPT-6 Astra这样的AI Agent的进展,不仅根据模型分数进行评估,还根据其部署系统,包括错误恢复和成本效益,特别是在涉及工具使用和物理操作的任务中。
-
OpenAI 的 Astra 模型在基准测试中领先,但面临 AI 安全审查
OpenAI 的新模型 Astra 在多项基准测试中表现出色,尤其在复杂的数学问题和抽象推理任务上,超越了 Claude Fable 5.1 和 GPT 5.6 Sol 等竞争对手。尽管 Astra 在通过开发符号模型解决新环境方面的效率值得注意,但一些 AI 安全研究人员对其声称是 OpenAI“最对齐的模型”表示怀疑,并指出潜在的潜在对齐驱动器问题。
-
ARC-AGI-3 基准面临价值和炒作的审视
ARC-AGI-3 基准正受到严格的重新评估,一些人认为尽管最初有炒作,但它几乎没有实际价值。作者就该基准的意义征求了 AI 模型 Claude 的意见。这种观点质疑了像 ARC-AGI-3 这样常用于衡量 AI 能力的基准的实际效用。
-
GPT-6 Astra 和 Claude Fable 5.1 在机器人控制任务中表现不一
Robocurve 的一项新评估将 OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Fable 5.1 在机器人控制任务中进行了对比。在简单的抓取积木任务中,GPT-6 Astra 表现出更优越的性能,成功率达到 95%,并且成本更低、速度更快,优于 Claude Fable 5.1。然而,在更复杂的拼图块插入任务中,两个模型表现相同,成功率仅为 10%。这表明,尽管当前的 LLM 在物理操作方面有…
-
OpenAI 的新模型因基准测试结果不一而引发争议
OpenAI 的最新模型引发了不同的反应,一些批评者认为其停滞不前,而另一些人则称赞其在 ARC-AGI-3 基准测试中的表现。在该测试中,一个名为 Astra 的系统据报道在不熟悉的环境中超越了人类中位数水平。
-
OpenAI 的 GPT-6 Astra 使用符号世界模型,在 AI "智商测试" 中接近满分 · 跟踪 2 个来源
OpenAI 的最新模型 GPT-6 Astra 在 ARC-AGI-3 智能测试中取得了接近满分的成绩,该测试旨在评估 AI 在新环境中的推理和解决问题的能力。该模型通过开发一个“符号世界模型”,在图形模式识别任务中展现出比人类更高的效率。这个内部模型将环境规则抽象成一种符号语言,能够在执行动作前进行精确预测和规划,这是对先前暴力试错方法的重大改进。然而,专家警告说,高昂的计算成本以及对外部“约束”的依赖来补充模型的能力,引发了关于…
-
Astra 语言模型在无 CoT 的情况下于 ARC-AGI 基准测试中取得高分
Astra 语言模型在 ARC-AGI 基准测试中取得了令人印象深刻的分数,在 ARC-AGI-3 上达到 97%,在 ARC-AGI-1 上达到 86%。值得注意的是,这些高分是在未使用思维链(CoT)提示的情况下获得的,这表明该模型具有强大的内在推理能力。