ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems
PulseAugur coverage of ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems — every cluster mentioning ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
FreeEvolve系统学会自动进化AI代理
研究人员开发了FreeEvolve,一个新颖的系统,可以自动设计语言模型的代理进化器。与依赖固定、手工设计的搜索循环的现有方法不同,FreeEvolve的进化器学会了关于测试、证据收集和候选者追求的决策。这种学习到的进化技能通过元进化得到进一步提高,其中候选技能根据它们产生的代理的性能进行评分。FreeEvolve在tau3-bench和ARC-AGI-2等基准测试中表现出显著的改进,优于手工设计的进化器,并显示出跨不同环境的可迁移学习。
-
四款新的前沿人工智能模型在基准测试、成本和访问方面进行比较
四款新的前沿人工智能模型——Claude Fable 5.1、GPT-6 Astra、GPT-6.1 Sol 和 Gemini 4 Argon——在一个月内发布,各有独特的优势和定价结构。虽然基准测试分数显示出一些重叠,但每项任务的成本、缓存能力和访问策略的差异显著影响了它们对各种应用的适用性。OpenAI 因内部测试失败取消了 GPT-6.1 Astra,将 GPT-6 Astra 作为其当前顶级模型。Gemini 4 Argon …
-
Gemini 3.1 Pro 与 Claude Opus 4.6:基准测试 vs. 实际使用
开发者发现,AI模型的基准测试分数并不总是能转化为实际性能,这在选择 Google 的 Gemini 3.1 Pro 和 Anthropic 的 Claude Opus 4.6 等选项时会造成困惑。虽然 Gemini 3.1 Pro 在 ARC-AGI-2 和 GPQA Diamond 等推理基准测试中表现出显著改进,并已修复输出截断问题,但据报道其在复杂的多步代理任务中的性能有所下降。相反,Claude Opus 4.6 尽管在一些…
-
新的“循环流”方法可提升 AI 在复杂任务上的推理能力
研究人员推出了一种新颖的循环神经网络训练方法“循环流”,通过在推理过程中允许更多的计算更新来增强其解决复杂问题的能力。该方法利用局部去噪目标和时间关联来有效训练循环状态,即使在梯度反向传播有限的情况下也能实现。该技术将推理表述为概率流速度的积分,能够进行多次预测并提高在推理基准测试上的性能,包括在 ARC-AGI-1 和 ARC-AGI-2 上取得最先进的成果。
-
Meta^n 为 LLM 代理引入递归自我改进
研究人员引入了 Meta$^n$,这是一种用于 LLM 代理的递归自我改进的新颖方法,可在不破坏系统稳定的情况下增强推理深度。与改进答案或编辑过程的先前方法不同,Meta$^n$ 保持核心元操作固定,而是对输入进行递归。该方法将固定操作 $\Omega$ 繰り返し应用于其自身的输出,使每个后续层都能从更高的视角进行推理。Meta$^n$ 在八个基准家族中表现出卓越的性能,尤其是在 ARC-AGI-2 基准测试中,其表现优于其他自我改进…
-
DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分
DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此…
-
TraceViT模型通过分步监督提升AI视觉抽象推理能力
研究人员推出了一种新颖的循环视觉推理模型TraceViT,旨在提高抽象推理任务的性能。与仅约束最终输出的先前方法不同,TraceViT通过使用语义单调变换链来训练,使其能够遵循变换过程的每一步。这些链是通过将程序化任务实现分解为中间网格状态来生成的,每次迭代都由任务引用和对象工作区进行约束。TraceViT在ARC-AGI-1上达到了67.8%的通过率,在ARC-AGI-2上达到了24.3%,证明了跟踪监督与约束相结合的好处。
-
Thinking Machines 发布 Inkling-Small,性能超越更大模型
Thinking Machines Lab 推出了 Inkling-Small,这是一款新的开源多模态模型,它优先考虑效率而非单纯的规模。尽管比其前身 Inkling 体积小得多,Inkling-Small 在各种编码和推理基准测试中表现出卓越的性能。该模型设计用于更轻松的部署,能够在一台 GPU 上运行,并根据 Apache 2.0 许可证提供。
-
新的 arXiv 论文探讨 LLM 可靠性和多智能体推理
一篇新的 arXiv 论文介绍了 CogniConsole,一个通过在固定模型周围实现结构性脚手架来提高 LLM 可靠性的框架,显著降低了故障率。另外,另一篇 arXiv 论文详细介绍了 ARCANA 多智能体框架,该框架旨在应对抽象推理挑战,并专门针对 ARC-AGI-2 基准。
-
新求解器在ARC-AGI-2基准测试中超越GPT-5.2 Pro和Gemini 3 Pro
一个用于ARC-AGI-2视觉推理基准测试的新求解器在半私有评估集上取得了72.9%的最高分,超越了GPT-5.2 Pro和Gemini 3 Pro等领先的前沿模型。该求解器采用模态驱动的搜索策略,跨文本、图像和代码生成推理候选,并使用整体判断方法在单个提示中比较这些候选。这种方法能有效识别正确的少数派假设,即使主要模态答案不正确。研究还强调,规定性提示和迭代改进会降低假设多样性并损害性能。
-
AI模型在7项能力上的对比:GPT-5.5、Claude Opus 4.8领跑
对八款AI模型在七个能力维度上的对比分析显示,没有一款是全能冠军。GPT-5.5在代理任务和长上下文方面表现出色,而Claude Opus 4.8在编码和通用知识方面领先。Gemini 3.5 Flash提供了强大的代理价值和多模态能力,DeepSeek V4 Pro则在竞技编程和数学方面展现出实力。
-
LLM应对CUDA调试和抽象推理,带来新基准和方法
两篇新研究论文探讨了大型语言模型(LLM)的高级调试和推理技术。第一篇论文介绍了CUDABeaver,这是一个旨在评估基于LLM的CUDA代码调试的基准,强调了修复过程中性能保持的挑战。第二篇论文提出了基于诱导的程序化改进(ABPR),这是一种结合LLM和Prolog进行算法调试的神经符号方法,在ARC-AGI-2等抽象推理任务上展示了显著的改进。
-
Google 的 Gemini 3.5 Flash 在编码和代理任务上超越 3.1 Pro
Google 的 Gemini 3.5 Flash 模型在多项关键基准测试中超越了其前身 Gemini 3.1 Pro,尤其是在编码和代理任务方面。这一新层级相比 3.1 Pro 提供了显著的成本降低 40%,并且输出生成速度大约快四倍。虽然 Gemini 3.5 Flash 在工具使用和代理性能方面表现出色,但 Gemini 3.1 Pro 在纯粹推理和新颖问题解决基准测试中仍保持优势。
-
TinyLM 模型在 ARC-AGI-2 视觉谜题基准测试中达到 21.7% 的准确率
研究人员开发了一种新颖的方法,使用 TinyLM(一种多视角 Transformer 模型)来应对 ARC-AGI-2 基准测试。该基准测试评估机器在人类直觉视觉解谜、泛化和规则应用方面的能力。该模型结合了测试时训练和专家产品技术,在训练集上达到了 96.1% 的准确率,在评估集上达到了 21.7% 的准确率。
-
OpenAI 的 GPT-5.5 在 ARC-AGI-2 基准测试中的表现已揭晓
最近的一项基准测试表明,GPT-5.5 在 ARC-AGI-2 基准测试中取得了 85.3% 的分数。这一结果将该模型的表现置于与该特定评估中的人类专家相当的水平。数据通过 LinkedIn 帖子分享。
-
Google DeepMind 发布由 Gemini 3.1 Pro 驱动的自主研究代理
Google DeepMind 推出了两款新的自主研究代理:Deep Research 和 Deep Research Max,均由 Gemini 3.1 Pro 驱动。这些代理旨在安全地分析用户提供或第三方数据,其中 Deep Research 针对交互式应用的性能进行了优化,而 Deep Research Max 则用于更详尽的后台任务。两款代理都能生成专业的、带有引用的报告和可用于演示的视觉效果,其中 Deep Research…
-
Google 升级 Gemini 3 Deep Think 以用于科学和工程领域
Google 发布了 Gemini 3 Deep Think 的升级版本,这是一种专门用于应对复杂科学、研究和工程挑战的推理模式。新版本已提供给 Google AI Ultra 订阅用户和通过 Gemini API 的部分研究人员。早期测试者已使用 Deep Think 识别同行评审论文中的逻辑缺陷,优化半导体材料的晶体生长,并加速物理组件的设计。该模型还创下了新的基准记录,包括在 Humanity's Last Exam 上设定了新…
-
新的 Gemini 3 Deep Think,Anthropic 300亿美元 @ 3800亿美元,GPT-5.3-Codex Spark,MiniMax M2.5
Google DeepMind 发布了 Gemini 3 Deep Think V2,这是 Google AI Ultra 订阅用户的新推理模式,并可通过 API 提前访问。该模型在 ARC-AGI-2 等基准测试中取得了 84.6% 的准确率,创下新的最先进水平,并在 Humanity's Last Exam 和竞赛编程方面表现出色。该模型还因其效率而受到关注,每项任务成本降低 82%,并在科学和工程工作流程中具有实际应用,包括论文…