ARC-AGI-1
PulseAugur coverage of ARC-AGI-1 — every cluster mentioning ARC-AGI-1 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Pathway 的 BDH-CQ 模型设定了新的 ARC-AGI-1 成本效益前沿
Pathway 发布了 BDH-CQ,一个拥有 1.5 亿参数的后 Transformer 模型,在 ARC-AGI-1 基准测试中取得了 29.5% 的分数。据报道,该模型设定了新的成本效益前沿,计算出的每任务成本仅为 0.0007 美元。该架构利用了循环记忆和潜在推理,不同于传统的长 token 思维链。这一发展可能与预测的记忆效率架构突破有关,OpenAI 研究员 Lukasz Kaiser 作为投资者和顾问参与其中。
-
DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分
DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此…
-
BDH-CQ模型在AI推理成本效率方面达到新的最先进水平
研究人员开发了BDH-CQ,一种将具身上下文学习与循环潜在推理相结合的新型推理模型。该模型使用推理时输入更新其记忆,并在潜在空间中迭代计算解决方案,而不对中间步骤进行口头表达。BDH-CQ在ARC-AGI-1基准测试中实现了成本效率新的最先进水平,其1.5亿参数配置在每任务成本为0.0007美元的情况下,pass@2达到了29.5%。
-
TraceViT模型通过分步监督提升AI视觉抽象推理能力
研究人员推出了一种新颖的循环视觉推理模型TraceViT,旨在提高抽象推理任务的性能。与仅约束最终输出的先前方法不同,TraceViT通过使用语义单调变换链来训练,使其能够遵循变换过程的每一步。这些链是通过将程序化任务实现分解为中间网格状态来生成的,每次迭代都由任务引用和对象工作区进行约束。TraceViT在ARC-AGI-1上达到了67.8%的通过率,在ARC-AGI-2上达到了24.3%,证明了跟踪监督与约束相结合的好处。
-
研究发现,仅凭两个因素即可预测AI基准分数
一篇新研究论文提出了一种名为BenchPress的方法,该方法仅使用两个关键分数即可预测前沿模型在众多基准测试中的表现。该研究分析了84个模型和133个基准测试,发现模型的整体表现主要由两个潜在因素决定。这种方法可以显著减少所需的评估次数,表明仅使用五个基准测试的子集就可以高精度地预测模型的完整评分卡。