FrontierMath Tier 4
PulseAugur coverage of FrontierMath Tier 4 — every cluster mentioning FrontierMath Tier 4 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
GPT-6 Astra攻克最后一道FrontierMath Tier 4数学难题 · 跟踪1个来源
GPT-6 Astra已成功解决了FrontierMath Tier 4基准测试中最后一道剩余的难题,该基准测试包含一系列旨在挑战先进AI模型的科研级数学问题。这一成就标志着一个重要的里程碑,因为该严格测试套件中的所有问题现在都至少被AI解决过一次。尽管Astra的直接得分是97.6%,但它在之前未解决问题上的突破意味着FrontierMath Tier 4基准测试现在被认为是饱和的,AI展示了先进的数学推理能力。
-
OpenAI发布GPT-6 Astra,可自主控制PC;小米18 Fold定价超1万美元
据报道,OpenAI发布了其迄今为止最强大的模型GPT-6 Astra,拥有百万级上下文窗口,并能自主操作电脑。该新模型在高级数学和抽象推理方面表现出显著的性能提升。在其他科技新闻中,小米总裁确认即将推出的小米18 Fold起售价将超过1万元人民币,定位为与苹果产品相比物超所值的选择。字节跳动也计划获得一笔巨额的296亿美元银团贷款,用于一般公司事务和为其日益增长的AI基础设施投资提供资金。
-
OpenAI 发布 GPT-6 Astra,声称在各项基准测试中达到新的最先进水平 · 跟踪 6 个来源
OpenAI 发布了其最新的最先进模型 GPT-6 Astra。该公司声称 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 等一系列基准测试中表现出色,在科学发现和专业任务方面取得了显著进展。OpenAI 还强调了 Astra 在用户意图对齐和理解方面的改进,将其定位为世界上最智能、最对齐且能够执行计算机任务的模型。
-
GPT-6 Astra 基准测试显示超越 Fable 5.1,用户期待 OpenAI 的进步
用户正在讨论即将推出的 GPT-6 Astra 模型,早期基准测试表明其性能优于 Fable 5.1 和 GPT Sol。GPT-6 Astra 在包括 ARC-AGI-3 和 SRE-Bench 在内的各种基准测试中得分很高,并有望成为 OpenAI 的重大进步。虽然 Fable 5.1 因其高级规划和写作能力而受到赞扬,但用户预计 Astra 将代表一个巨大的飞跃。
-
谷歌DeepMind AI协助数学家,在FrontierMath基准测试中名列前茅
谷歌DeepMind发布了一个名为“AI Co-Mathematician”的AI系统,旨在与人类数学家合作解决复杂问题。该系统基于Gemini 3.1 Pro构建,在极具挑战性的FrontierMath Tier 4基准测试中取得了48%的新SOTA分数,显著优于GPT-5.5 Pro等现有模型。该AI作为一个异步工作空间,配备一个协调代理,负责分解任务、管理并行研究流,并持久存储失败的假设,这与软件开发中的工作流程相似。