GDPval-AA v2
PulseAugur coverage of GDPval-AA v2 — every cluster mentioning GDPval-AA v2 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Anthropic 的 Claude Opus 5 领跑 agentic 指数,Qwen3.8 Max 紧随其后 · 跟踪 1 个来源
Artificial Analysis 的 Agentic Index 显示 Anthropic 的 Claude Opus 5 领先,阿里巴巴集团的 Qwen3.8 Max 紧随其后。虽然一些报道错误地宣称 Qwen 是顶级模型,但该指数实际上将 Claude Opus 5 置于最高推理努力的第一位,Qwen3.8 Max 并列第二。该指数的方法论通过平均 agentic 基准测试和检查数据库状态,而不是依赖模型摘要,突显了严格评估的重要性。
-
Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美
Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…
-
Google 发布更便宜的 Gemini Flash 模型,优先考虑成本而非巅峰性能
Google 发布了三款新的 Gemini Flash 模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——专注于大规模 AI 代理的成本效益。与早期版本相比,3.6 Flash 模型减少了输出 token 消耗并降低了价格,在各种基准测试中表现有所提高。虽然这些模型优先考虑效率和成本降低,但 Google 承认其旗舰 Gemini 3.5 Pro 仍处于合作伙伴测试阶段,而 Gemini …
-
Anthropic 发布 Claude Sonnet 5,增强代理能力
Anthropic 发布了 Claude Sonnet 5,这是其更新的中端模型,在代理能力和性能方面显著优于其前身 Sonnet 4.6。新模型在规划、浏览器和终端导航以及自主任务执行方面展现出增强的能力,使其更适合复杂的多步操作。虽然 Sonnet 5 提供了强大的成本效益比,尤其是在较低的努力水平下,但 Anthropic 建议将旗舰 Opus 4.8 模型保留用于高度准确性关键的任务。
-
Claude Fable 5 在 AI 性能排行榜上领先,但也是最昂贵的模型
一项名为 gdpval-aa v2 的新评估使用基于人类基线的 Elo 评分系统,衡量 AI 模型在真实世界任务上的性能。Anthropic 的 Claude Fable 5、Sonnet 5 和 Opus 4.8 模型位列前三名,表现优于 Grok 4.5、GLM-5.2 和 GPT-5.5 等模型。虽然 Claude 模型在原始性能上领先,但它们也是最昂贵的,而 Grok 4.5 因提供性能和成本的良好平衡而受到关注。