AutomationBench
PulseAugur coverage of AutomationBench — every cluster mentioning AutomationBench across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
上海人工智能实验室发布 744B MoE 智能体模型 Atria Dawn Preview
上海人工智能实验室发布了 Atria Dawn Preview,一个拥有 7440 亿参数的混合专家(Mixture-of-Experts)模型。该模型基于 GLM-5.2 构建,专为长时程研究和工程工作流设计,并拥有 256K 的上下文窗口。在智能体任务方面,它取得了 53.8 的领先 AutomationBench 分数。
-
OpenAI 发布 GPT-6 Astra,声称在各项基准测试中达到新的最先进水平 · 跟踪 6 个来源
OpenAI 发布了其最新的最先进模型 GPT-6 Astra。该公司声称 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 等一系列基准测试中表现出色,在科学发现和专业任务方面取得了显著进展。OpenAI 还强调了 Astra 在用户意图对齐和理解方面的改进,将其定位为世界上最智能、最对齐且能够执行计算机任务的模型。
-
Anthropic 的 Claude Fable 5.1 发布,基准测试有所提升,成本引发争议 · 已追踪 10 个来源
Anthropic 发布了其新一代 AI 模型 Claude Fable 5.1,现已在 Cursor 和 Perplexity 等平台上可用。此次发布在基准测试方面取得了显著进步,尤其是在智能体任务和减少对良性查询的拒绝方面。然而,定价结构仍然是讨论的焦点,实际成本因缓存命中率和工作负载类型而异,引发了关于其是否物有所值(与 Opus 5 相比价格翻倍)的争论。
-
大型科技公司在价格战和可靠性担忧中竞相推出AI代理
大型科技公司正加速推出AI代理,这得益于竞争性的定价策略和潜在的市场抢占机会。Google的Gemini 3.7 Flash和Anthropic的Claude Sonnet 5正以降低的入门价格提供,以鼓励开发人员将其集成到他们的生态系统中。除了定价,可靠性正成为一个关键因素,团队正在采用模型回退策略来减轻单一提供商潜在的停机风险。重点也正从以开发人员为中心的工具转向通用生产力代理,Anthropic的Cowork是其中的典范,它面向…
-
Google 发布 Gemini 3.7 Flash,性能大幅提升且价格下调 · 跟踪 9 个来源
Google 发布了 Gemini 3.7 Flash,这是其用于编码和 AI 代理的旗舰模型的最新版本,距离前代 Gemini 3.6 Flash 发布仅三周。此次更新在软件工程、知识工作和 Web 开发方面提供了显著的性能改进,在编码准确性和复杂文档处理方面取得了显著进展。Gemini 3.7 Flash 的推出价格也比其前代产品低一半,旨在为开发人员和客户提供具有成本效益的扩展。新模型已集成到 Gemini Spark 中,增强…
-
Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源
Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。