GDPval-AA
PulseAugur coverage of GDPval-AA — every cluster mentioning GDPval-AA across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
GPT-6 Luna 发布,价格减半,输出字数缩短
GPT-6 Luna 已发布,与前代 GPT-5.6 Luna 相比,成本显著降低。虽然在通用基准测试上的性能相当,但 GPT-6 Luna 在仅给出目标时会产生更短的输出,并且每项任务的成本效益更高。然而,这种简洁性可能导致遗漏,例如在事后复盘中省略事件持续时间,而 GPT-5.6 Luna 较少出现这种行为。当提供具体要求时,GPT-6 Luna 表现出更完整的输出,并且成本仍然显著降低。
-
Anthropic、OpenAI引领AI竞赛;开源模型缩小差距 · 跟踪1个来源
2026年秋季,AI领域由Anthropic的Claude Opus 5.5和OpenAI的GPT-6 Astra主导,它们在编码、推理和知识基准测试中领先。Moonshot和DeepSeek等实验室的开源模型正在迎头赶上,大约落后三到八个月。对于开发者来说,订阅成本和使用限制正变得比微小的基准分数差异更关键,GPT-6.1 Sol和Sonnet 5.5等模型的定价在中端市场正在崩溃。
-
Anthropic 发布 Claude Sonnet 5.5,专注于为开发者提供成本效益
Anthropic 发布了 Claude Sonnet 5.5,这是一款专为日常任务的效率和成本效益而设计的新模型。虽然它不追求极致性能,但与前代 Sonnet 5 相比,其输出生成速度提升了 30% 以上,每项任务的成本降低了高达 30%。这使其成为开发者在修复错误、编写文档和常规代码生成等任务的更实用选择。该模型可通过 API、AWS、Google Cloud 和 Azure 使用,并具有 100 万个 token 的上下文窗口。
-
Anthropic 发布 Claude Sonnet 5.5,成本更低,性能接近 Opus · 跟踪 10 个来源
Anthropic 发布了 Claude Sonnet 5.5,这是其之中档语言模型的新迭代。此次更新在性能上有了显著提升,与前代 Sonnet 5 相比,许多任务的速度提升高达 30%,成本降低高达 30%。虽然价格与 Sonnet 5 相同,但 Sonnet 5.5 在各种基准测试中展现了增强的功能,尤其是在编码和智能体任务方面,其性能常常接近更高端的 Opus 5.5 模型。新模型现已在 Claude Platform 和主要云…
-
分析称 OpenAI 的 GPT-6 Astra 在图形方面取得重大进展
Sebastian Raschka 的分析表明,OpenAI 的新 GPT-6 Astra 模型在图形任务方面比前代 GPT-5.6 "Sol" 有显著改进,并在 ARC-AGI-3 基准测试中取得了近乎完美的成绩。虽然 Astra 在数学和编码方面表现出色,但其在代理编码任务上的领先优势不那么明显,这可能归因于基准测试特定的训练。文章还深入探讨了“循环 Transformer”的概念及其与高级 AI 模型中“隐藏推理”的潜在联系。
-
Anthropic 的 Claude Opus 5 支持动态工具切换和改进的基准测试
Anthropic 发布了 Claude Opus 5,价格与 Opus 4.8 保持一致,并声称拥有近乎前沿的智能和显著的基准测试改进。此次发布包括两项 beta 功能:能够在不使提示缓存失效的情况下,动态更改代理在对话中可用的工具;以及对安全分类器标记的请求的自动回退。对话中工具的更改尤其值得注意,它通过将工具选择与初始提示分离,实现了更灵活的代理开发。
-
Anthropic 发布 Claude Opus 5,在基准测试中挑战 Fable 5
Anthropic 推出了 Claude Opus 5,这是一款新的前沿模型,以更低的成本提供了接近 Claude Fable 5 的性能。早期评估显示,Opus 5 在编码和知识工作中表现出色,在 Frontier-Bench 和 ARC-AGI 等任务上设定了新的最先进基准。虽然它在 3D 模型重建和复杂编码任务等领域展现了强大的能力,但其在网络安全利用方面的表现仍落后于 Mythos 5 等模型。用户报告的体验褒贬不一,一些人称…
-
GLM-5.2 在真实世界代理工作基准测试中领先开源模型 · 跟踪 2 个来源
GLM-5.2 已成为上周 Fireworks AI 平台上最受欢迎的新模型。该开源模型在 GDPval-AA 基准测试中位列第三,该基准测试评估在真实世界知识工作任务上的表现。GLM-5.2 在此基准测试中也以显著优势领先所有其他开源模型。
-
Fireworks AI 提供智谱 AI 的 GLM-5.2,顶级开源编码模型
Fireworks AI 已宣布 GLM-5.2 现已在其推理平台上可用,并强调其作为顶级开源编码模型和 GDPval-AA 基准测试中第三名的性能。该模型由智谱 AI(前身为 Z.ai)开发,拥有 100 万个 token 的上下文窗口,专为长时任务设计。Fireworks AI 在其自有基础设施上独立验证了 GLM-5.2 的能力,确认了其强大的推理和编码性能。
-
Google DeepMind 发布 Gemini 3.5 Flash,用于加速代理任务
Google DeepMind 推出了 Gemini 3.5 Flash,这是一款针对速度和代理任务进行了优化的新型前沿智能模型。该模型在编码和代理开发等复杂、长周期的任务方面表现出色,在 Terminal-Bench 2.1 和 GDPval-AA 等基准测试中优于之前的 Gemini 版本。Gemini 3.5 Flash 现已通过 Gemini 应用、Google AI Studio 和企业解决方案等各种 Google 平台在全…
-
X推出Grok 4.3,代理性能提升且价格更低
xAI发布了其AI模型的新迭代Grok-4.3,与前代相比,它提供了更强的代理性能和更低的价格。该模型在Artificial Analysis GDPval-AA基准测试中取得了321 ELO点的显著提升,总得分达到1500。这一性能超越了其他领先模型,使Grok-4.3成为AI市场上的有力竞争者。
-
小米的MiMo-v2.5-Pro开源模型可与顶级AI编码助手相媲美
小米发布了MiMo-v2.5-Pro,这是一款专注于编码的开源语言模型,在复杂任务中展现出令人印象深刻的能力。该模型在数小时内成功完成了一个大学级别的编译器项目,根据模糊的提示构建了一个功能齐全的视频编辑器应用程序,并解决了模拟电路设计问题。MiMo-v2.5-Pro在编码基准测试中表现强劲,可与GPT-5.4和Claude Opus 4.6等顶级闭源模型相媲美,现已在HuggingFace上发布。