ARC Prize
PulseAugur coverage of ARC Prize — every cluster mentioning ARC Prize across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
行业被指控歪曲人工智能迈向通用人工智能的进展
行业被指控重新定义术语,以虚假声称在迈向通用人工智能(AGI)方面取得进展。特别是,围绕ARC-AGI分数的炒作被强调为这种歪曲的一个例子。作者认为,目前的大型语言模型(LLMs)远未达到AGI,因为它们缺乏产生原创思想或执行非语言推理的能力。
-
Anthropic 的 Claude Fable 5.1 降低缓存成本但提高每任务价格
Anthropic 发布了 Claude Fable 5.1,其缓存读取成本显著降低了 75%,使得涉及重复上下文的任务成本更低。然而,由于更高的“努力”成本,每任务成本约增加了 20%,这在单次请求、高努力场景中占主导地位。这种定价结构意味着 Fable 5.1 对于长期运行的代理任务可能更经济,但对于高强度的单次请求则更昂贵,具体取决于工作负载。
-
OpenAI 的 Astra 基准测试得分显示存在 37 分的差异
OpenAI 的 Astra 模型评估中出现了显著差异。OpenAI 报告称其专有基准测试得分高达 99.9%,但开发该测试的 ARC Prize 在中立平台上发现 Astra 的得分仅为 62.7%。这 37 分的差异引发了对 OpenAI 自我报告基准测试在采购方面可靠性的质疑。
-
据报道,OpenAI 发布 GPT-6 Astra,引发对其能力和安全的辩论
据报道,OpenAI 已发布 GPT-6 Astra,早期用户和评论者分享了初步印象。Gary Marcus 指出其令人印象深刻的能力,特别是其创建和操纵符号世界模型的能力,这印证了他长久以来的观点。然而,他也对这些能力的稳健性、从安全角度对系统的可监控性以及对其内部运作缺乏透明度表示担忧。与此同时,出现了将 GPT-6 Astra 与 GPT-5.6 Sol、Terra 和 Luna 等先前模型进行比较的说法,一些用户分享了生成的图…
-
AI研究应对推理成本和LLM安全漏洞
研究人员开发了一种使用循环潜在推理的方法,以降低ARC-AGI基准的推理成本。该方法旨在使复杂的AI推理任务在计算上更有效率。此外,另一项研究探讨了攻击者如何利用跨模型兼容性从大型语言模型中提取专有推理痕迹。
-
ARC-AGI 奖项侧重于流体智力,借鉴神经科学
2026 ARC-AGI 奖项于三月启动,接受投稿至十一月八日,侧重于衡量流体智力而非晶体知识。该方法旨在通过评估技能获取效率和对新颖问题的适应性,来创建人工智能和人类智力之间的公平比较。该奖项的方法论从神经科学中汲取灵感,特别引用了 Elizabeth Spelke 的核心知识理论及其与顶内沟和梭状回等大脑解剖结构的关系。
-
DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分
DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此…
-
DeepSeek V4 Flash 0731 登顶 ARC-Prize 基准测试
DeepSeek V4 Flash 0731 在 ARC-Prize 基准测试中取得了最高排名,展示了其在复杂推理任务中的强大性能。这一成就凸显了该模型在人工智能研究方面的先进能力。
-
Fireworks AI 的 Kimi K3 模型展示了增强的网络安全防御能力
Fireworks AI 宣布对其 Kimi K3 模型进行了改进,该模型专注于网络安全防御。该公司声称 Kimi K3 在 CyberGym E2E 基准测试中实现了两倍的漏洞检测能力和三倍的补丁修复能力。Fireworks AI 还表示,Kimi K3 的表现优于 GPT-5.5 和 Opus 4.8 等模型,而 GPT-5.6 和 Fable 模型则拒绝协助此类任务。
-
TraceViT模型通过分步监督提升AI视觉抽象推理能力
研究人员推出了一种新颖的循环视觉推理模型TraceViT,旨在提高抽象推理任务的性能。与仅约束最终输出的先前方法不同,TraceViT通过使用语义单调变换链来训练,使其能够遵循变换过程的每一步。这些链是通过将程序化任务实现分解为中间网格状态来生成的,每次迭代都由任务引用和对象工作区进行约束。TraceViT在ARC-AGI-1上达到了67.8%的通过率,在ARC-AGI-2上达到了24.3%,证明了跟踪监督与约束相结合的好处。
-
新的LaughBench基准测试AI讲笑话的能力
一个名为LaughBench的新基准已被引入,用于评估AI模型生成新颖、有趣笑话的能力,其创建者认为这是通用智能的一个有力指标。虽然像GPT 5.6 "Sol"和Fable这样的当前前沿模型偶尔能引人一笑,但还没有模型能够持续地引人发笑。该基准旨在衡量超越可以通过记忆或计算掌握的任务的“真正的智能”,并将其与FrontierMath Open Problems和Arc Agi等基准区分开来,后者可能可以通过专业技能而非广泛的智能来解决。
-
ARC Prize 2024 因行话和缺乏持久影响而受到批评
ARC Prize 2024 因使用行话和缺乏长期影响而受到批评,一篇社交媒体帖子暗示参与者将不记得比赛的未来迭代。该帖子强调排行榜是参与者肤浅的验证来源。
-
ARC-AGI 排行榜发布,引发人工智能竞赛讨论
ARC-AGI 排行榜已发布,展示了各种模型在 ARC-AGI 基准测试上的表现。该排行榜为通用人工智能 (AGI) 领域的竞争和创新提供了一个平台。此发布在 Hacker News 和 Mastodon 等平台上引发了讨论。
-
Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得 4 倍领先优势
Anthropic 发布了 Claude Opus 5,该模型在 ARC-AGI-3 基准测试中取得了经核实的 30.16% 的分数,比之前的最佳成绩 7.78% 有了显著的四倍提升。该基准测试旨在评估 AI 在没有明确指令的情况下,在不熟悉交互环境中的适应能力。新模型拥有百万级 token 的上下文窗口,并且 API 定价与前代 Opus 4.8 相同,但其默认的推理能力可能会增加部分用户的运营成本。
-
AI归纳问题以骰子游戏为例进行说明,强调算法的权衡取舍
文章探讨了归纳法的基本挑战,即从观察到理解的过程,这仍然是人工智能和科学领域一个重大的未解决问题。文章使用一个简单的骰子游戏作为具体例子,来说明“没有免费午餐”定理,并强调算法学习方法固有的权衡取舍。作者讨论了各种机器学习算法在此任务上的表现,旨在提供关于为什么某些AI架构(如Transformers)有效以及ARC-AGI等基准测试重要性的实际直觉。
-
人工智能的下一次飞跃可能是选择知识,而非生成文本
一种新的人工智能开发方法表明,未来的突破可能并非来自简单地扩大模型规模,而是来自优化人工智能管道的其他部分。一种提出的方法涉及“逆向人工智能”架构,其中语言模型充当语义规划器,选择并返回现有知识块的标识符,而不是生成新文本。这可能导致更低的推理成本、更快的响应速度以及更少的幻觉,尤其适用于需要确定性和可审计输出的应用。
-
FactorDiff 框架通过因子专家组合增强离散扩散模型 · 跟踪 2 个来源
研究人员推出了 FactorDiff,一个用于离散扩散模型的新颖框架,通过将样本分解为更小的因子来增强组合生成。这种方法允许每个因子动态地路由到最相关的专家,从而提高泛化和推理能力。FactorDiff 在 ARC-AGI 基准测试上得到了验证,在需要逻辑一致性和空间解耦的任务上表现优于全局加权方案。
-
ARC-AGI基准被验证为人类流体智力测量指标
一项新研究验证了ARC-AGI基准作为人类流体智力测量指标的有效性。研究人员发现,该基准主要测试规则归纳能力,具有良好的心理测量学特性,并与另一项推理测试测得的图形流体智力显著相关。然而,它与图形原创性的关联较弱,这表明未来的研究应纳入更多规则归纳任务和额外的协变量,以进一步探索其有效性。
-
ARC-AGI基准被验证为人类流体智力测量指标
一项新研究验证了ARC-AGI基准作为人类流体智力测量指标的有效性,发现它与图形流体智力显著相关。该研究对100名参与者进行了测试,表明ARC-AGI基准(主要评估规则归纳能力)是评估人类认知能力的合适工具。这项工作弥合了AI基准与人类认知科学之间的差距,并提议将AI任务进一步融入人类智力的研究中。
-
ChatGPT 5.6 据称在 ARC-AGI 3 基准测试中得分
r/singularity 上的一个 Reddit 帖子讨论了 ChatGPT 5.6 及其在 ARC-AGI 3 基准测试中的报告分数。该帖子包含一张似乎与此分数相关的截图。