PulseAugur
中
实时 05:40:10
实体 ARC-AGI-1

ARC-AGI-1

PulseAugur coverage of ARC-AGI-1 — every cluster mentioning ARC-AGI-1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_270342 ·

    神经细胞自动机在复杂视觉任务中展现推理能力

    研究人员已经证明,神经细胞自动机(NCAs)——一种利用严格局部连接和异步更新的AI架构——可以执行复杂的多步推理任务。这些NCAs在解决具有挑战性的视觉推理问题方面表现出色,例如大型迷宫、数独和ARC-AGI-1基准测试。研究表明,NCAs能够很好地泛化到不同的网格大小和回放时长,尤其是在使用样本回放和随机扰动进行训练时,甚至可以通过动态调节计算来从损坏中恢复。

  2. TOOL · CL_247782 ·

    新的“循环流”方法可提升 AI 在复杂任务上的推理能力

    研究人员推出了一种新颖的循环神经网络训练方法“循环流”,通过在推理过程中允许更多的计算更新来增强其解决复杂问题的能力。该方法利用局部去噪目标和时间关联来有效训练循环状态,即使在梯度反向传播有限的情况下也能实现。该技术将推理表述为概率流速度的积分,能够进行多次预测并提高在推理基准测试上的性能,包括在 ARC-AGI-1 和 ARC-AGI-2 上取得最先进的成果。

  3. TOOL · CL_235965 ·

    Astra 语言模型在无 CoT 的情况下于 ARC-AGI 基准测试中取得高分

    Astra 语言模型在 ARC-AGI 基准测试中取得了令人印象深刻的分数,在 ARC-AGI-3 上达到 97%,在 ARC-AGI-1 上达到 86%。值得注意的是,这些高分是在未使用思维链(CoT)提示的情况下获得的,这表明该模型具有强大的内在推理能力。

  4. RESEARCH · CL_230007 ·

    小型 Transformer 模型在 ARC-AGI-1 基准测试中取得 44% 的准确率,成本仅为 67 美分

    一位研究人员开发了一个小型 Transformer 模型,在 ARC-AGI-1 基准测试中达到了 44% 的准确率,这项重大成就仅耗时 1.5 小时,成本仅为 67 美分。该模型超越了许多现有的语言模型,并在这一具有挑战性的元学习基准测试上取得了与先前最先进结果相当的成绩。研究人员的工作侧重于提高 AI 的样本效率,旨在降低成本并加速 AI 研究的迭代周期。

  5. RESEARCH · CL_201277 ·

    1.5亿参数循环模型以低成本实现强劲ARC-AGI-1得分 · 跟踪2个来源

    一款新的循环潜在推理模型,其参数量远小于典型的Transformer模型,在ARC-AGI-1基准测试中取得了29.5%的显著得分。该模型运行成本极低,每次任务仅为0.0007美元,并且能够在标准硬件上运行。尽管结果令人鼓舞,但随着模型扩展到更大的参数量,仍需要进一步评估。

  6. TOOL · CL_194794 ·

    Pathway 的 BDH-CQ 模型设定了新的 ARC-AGI-1 成本效益前沿

    Pathway 发布了 BDH-CQ,一个拥有 1.5 亿参数的后 Transformer 模型,在 ARC-AGI-1 基准测试中取得了 29.5% 的分数。据报道,该模型设定了新的成本效益前沿,计算出的每任务成本仅为 0.0007 美元。该架构利用了循环记忆和潜在推理,不同于传统的长 token 思维链。这一发展可能与预测的记忆效率架构突破有关,OpenAI 研究员 Lukasz Kaiser 作为投资者和顾问参与其中。

  7. SIGNIFICANT · CL_191626 ·

    DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分

    DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此…

  8. RESEARCH · CL_193219 ·

    BDH-CQ模型在AI推理成本效率方面达到新的最先进水平

    研究人员开发了BDH-CQ,一种将具身上下文学习与循环潜在推理相结合的新型推理模型。该模型使用推理时输入更新其记忆,并在潜在空间中迭代计算解决方案,而不对中间步骤进行口头表达。BDH-CQ在ARC-AGI-1基准测试中实现了成本效率新的最先进水平,其1.5亿参数配置在每任务成本为0.0007美元的情况下,pass@2达到了29.5%。

  9. TOOL · CL_178347 ·

    TraceViT模型通过分步监督提升AI视觉抽象推理能力

    研究人员推出了一种新颖的循环视觉推理模型TraceViT,旨在提高抽象推理任务的性能。与仅约束最终输出的先前方法不同,TraceViT通过使用语义单调变换链来训练,使其能够遵循变换过程的每一步。这些链是通过将程序化任务实现分解为中间网格状态来生成的,每次迭代都由任务引用和对象工作区进行约束。TraceViT在ARC-AGI-1上达到了67.8%的通过率,在ARC-AGI-2上达到了24.3%,证明了跟踪监督与约束相结合的好处。

  10. RESEARCH · CL_107855 ·

    研究发现,仅凭两个因素即可预测AI基准分数

    一篇新研究论文提出了一种名为BenchPress的方法,该方法仅使用两个关键分数即可预测前沿模型在众多基准测试中的表现。该研究分析了84个模型和133个基准测试,发现模型的整体表现主要由两个潜在因素决定。这种方法可以显著减少所需的评估次数,表明仅使用五个基准测试的子集就可以高精度地预测模型的完整评分卡。