Artificial Analysis Intelligence Index
PulseAugur coverage of Artificial Analysis Intelligence Index — every cluster mentioning Artificial Analysis Intelligence Index across labs, papers, and developer communities, ranked by signal.
- instance of Kimi k3 90%
- instance of Claude Opus-5 90%
- instance of Opus 4.8 90%
- instance of SpaceXAI 90%
- instance of GLM-5.2 90%
- competes with GPT 5.6 "Sol" 80%
- instance of Claude Fable-5 70%
- instance of GPT 5.6 "Sol" 70%
- competes with Claude Opus-5 70%
- competes with Kimi k3 70%
- competes with Claude (Opus 4.8) 70%
- instance of Claude (Opus 4.8) 70%
11 天有情绪数据
-
GLM-5.3 在 AI 指数上与 Kimi K3 持平,等待完全发布 · 跟踪 2 个来源
Z.ai 的 GLM-5.3 模型在人工智能分析指数上获得了 60 分,与 Kimi K3 的表现持平。这比其前身 GLM-5.2 提高了 7 分。虽然该模型比竞争对手更便宜,但据报道其完全发布有所延迟。
-
GLM-5.3 (max) 在人工智能智能指数中获得 60 分,提供 100 万上下文窗口
GLM-5.3 (max) 在人工智能分析智能指数上进行了评估,得分 60,远高于同类模型 35 的中位数。该专有模型由 Z AI 开发,拥有 100 万个 token 的上下文窗口,并相对于其成本展现出强大的智能。虽然在评估期间生成了大量输出 token,但其输入和输出 token 的定价被认为是适中的。
-
阿里巴巴的 Qwen3.8-27B 性能媲美 GPT 5.6 Luna,可在本地运行
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个开放权重模型,在人工智能分析指数上获得了 52 分。据报道,该新模型在性能上媲美 GPT 5.6 Luna,同时还能够在包括通过 WebGPU 在浏览器中运行在内的用户设备上本地运行。
-
Qwen 3.8 27B 模型在 AI Index 上获得 52 分,与 GPT 5.6 Luna 持平 · 跟踪 8 个来源
Qwen 3.8 27B 模型在 Artificial Analysis 智能指数上获得了 52 分,与 GPT 5.6 Luna 持平,接近 GLM-5.2 和 DeepSeek V4 Pro 0813。该模型由 Alibaba Group 开发,是开源权重模型,支持文本和图像输入,拥有 256k 上下文窗口,并以其具有竞争力的价格和相对于其规模的强劲性能而闻名。它还被强调为能够进行多模态处理的推理模型。
-
SpaceXAI 升级 Grok 4.6,采用训练后增强,而非全新基础
SpaceXAI 发布了 Grok 4.6,这是 Grok 4.5 的升级版本,而非全新的基础模型。此次训练后增强显著提高了其在 Artificial Analysis Intelligence Index 和 Terminal-Bench v3 等基准测试中的表现,同时保持了相同的代币价格。该公司的策略侧重于通过先进的训练技术(如代理环境中的强化学习)来优化现有模型,以在不增加运营成本的情况下提升能力。
-
OpenAI 的 GPT-5.6 Sol 在代码生成方面表现出色,但在数据库填充方面遇到困难
OpenAI 发布了 GPT-5.6 Sol,该模型在编码任务和令牌效率方面取得了显著进步,在基准测试中优于 Claude Opus 4.8 等先前模型。然而,该模型在填充数据库方面遇到困难,这项任务需要对给定模式的特定知识,而这些知识在其通用训练数据中并不存在。这一限制成为瓶颈,因为由于模型无法了解或创建必要的父行,其生成的代码在与真实数据库约束交互时经常失败。
-
xAI 的 Grok 4.6 赶上 GPT-5.6 Sol,强调智能体耐用性和工具集成
xAI 发布了 Grok 4.6,该模型在人工智能分析智能指数上赶上了 OpenAI 的 GPT-5.6 Sol。然而,关键创新不在于基准分数,而在于 Grok 4.6 专注于能够执行复杂、多步骤任务的长期运行智能体,尤其是在编码方面。这一转变反映了更广泛的行业趋势,即在实际应用中,可靠性、工具集成和有竞争力的定价正变得比原始智能分数更重要。
-
xAI 的 Grok 4.6 匹配 OpenAI 的 GPT-5.6 Sol,在代理任务上优于 Claude Opus 5
xAI 的 Grok 4.6 在人工智能分析指数上已达到与 OpenAI 的 GPT-5.6 Sol 的同等水平。此外,Grok 4.6 在代理任务方面展现了更高的效率,仅用 53 步即可完成,而 Claude Opus 5 则需要 103 步。此性能是在成本显著降低的情况下实现的。
-
SpaceXAI的Grok 4.6凭借强大的代理性能和更低的成本触及AI前沿 · 跟踪4个来源
SpaceXAI的Grok 4.6在人工智能分析指数中获得了61分,跻身顶级AI模型之列。与一些竞争对手相比,新版本在代理性能和回合效率方面有了显著提高,以更少的回合和更少的token使用量完成了复杂任务。值得注意的是,Grok 4.6保持了其先前的定价结构,以低于GPT-5.6 Sol和Claude Opus 5等领先模型的成本提供了具有竞争力的智能。
-
SpaceXAI 发布 Grok 4.6,在关键基准测试中可与 GPT-5.6 Sol 相媲美
SpaceXAI 发布了 Grok 4.6,这是一款新的前沿智能模型,在处理长时代理和复杂交互任务方面比 Grok 4.5 有显著改进。该模型在人工智能分析智能指数上可与 GPT-5.6 Sol 相媲美,并提供有竞争力的定价,使其成为人工智能领域的一支强大竞争者。Grok 4.6 现已通过 Cursor、Grok Build 和各种 API 合作伙伴提供,在编码、研究和应用程序开发方面具有增强的功能。
-
Meta 的 Muse Spark 1.2 展现出快速的性能提升,可与顶级 AI 模型相媲美
Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后…
-
Qwen3.8 Max 赶上 Claude Opus 4.8,但 Kimi k3 仍更具成本效益
阿里巴巴的 Qwen3.8 Max 显著提升了性能,在人工智能分析指数中获得 56 分。这标志着其从之前的版本 Qwen3.7 Max(得分为 46)取得了巨大飞跃。虽然 Qwen3.8 Max 的性能现已赶上 Anthropic 的 Claude Opus 4.8,但 Kimi k3 模型仍以更低的成本提供更优越的结果。
-
中国AI市场呈现双重竞争:高能力与高性价比
华泰证券建议关注AI应用和国产模型作为关键投资领域,这得益于大模型竞争正转向成本效益的趋势。OpenAI已降低其Terra和Luna模型的价格,而DeepSeek V4 Flash 0731则以显著更低的成本提供了有竞争力的性能。这种定价动态,加上Kimi K3等模型的强劲表现,表明中国AI市场存在高能力和高性价比的双重竞争策略,这可能会促进下游应用的普及。
-
四大中国AI实验室于2026年夏季发布前沿模型 · 追踪到1个来源
2026年夏季,四家主要的中国AI实验室发布了前沿规模的模型,标志着开放权重可用性方面的重要转变。Moonshot的Kimi K3在Artificial Analysis Intelligence Index和Arena排行榜上取得了顶尖的第三方验证分数。智谱的GLM 5.2,一个专注于编码和代理的专家模型,也获得了高排名,并提供经济实惠的API访问。阿里巴巴的Qwen 3.8 Max,最新的旗舰模型,声称性能接近顶尖的专有模型,但有…
-
2026 LLM基准测试:没有赢家,专业化领导者涌现 · 跟踪1个来源
对2026年20个领先LLM的全面基准测试显示,没有单一的占主导地位的模型,而是出现了跨不同任务的专业化领导者。Claude Opus 5在整体人工智能分析智能指数中领先,而特定模型在编码、代理工具使用、推理和价值方面表现出色。报告强调了成本效益日益增长的重要性,中国的开放权重模型以一小部分价格提供了具有竞争力的性能。它还提醒读者注意基准测试的素养,指出经典的评估已饱和,需要在一致的条件和工具使用下比较模型。
-
Anthropic 发布 Claude Opus 5,性能超越 Fable 5 和 GPT-5.6 Sol
Anthropic 发布了其新的旗舰模型 Claude Opus 5,该模型在包括代理编码和知识工作在内的各种基准测试中表现出卓越的性能,超越了 Fable 5 和 GPT-5.6 Sol 等模型。该公司强调 Opus 5 先进的对齐能力,以及其在安全性的同时匹配 Mythos 5 进行错误检测的能力。此次发布旨在为价格更高的模型提供强大且经济高效的替代方案,定价为每百万个 token 5 美元和 25 美元,与前代 Opus 4.8 类似。
-
Anthropic 的 Claude Opus 5 占据顶级 AI 基准榜首,价格下调 · 跟踪 1 个来源
Anthropic 发布了 Claude Opus 5,一款新的旗舰级 AI 模型,在人工智能分析智能指数(Artificial Analysis Intelligence Index)和 Agentic Index 等独立基准测试中取得了顶级排名。该模型在包括 Agentic 终端编码和新颖推理在内的各种任务上,显著优于其前身 Claude Opus 4.8 以及 Claude Fable 5 和 GPT-5.6 Sol 等竞争对手…
-
Anthropic 的 Claude Opus 5 将最高性能模式的成本翻倍,提供 100 万上下文
Anthropic 发布了 Claude Opus 5,该模型提供 100 万的上下文窗口和五个性能级别,默认启用“思考”功能。虽然基础 API 定价与 Opus 4.8 相比保持不变,但新的“最高性能”设置显著增加了成本。评估显示,在人工智能分析智能指数(Artificial Analysis Intelligence Index)上提高 2 个点,成本增加了 94%。该模型默认的“思考”功能和更长的输出倾向也可能导致账单高于预期,…
-
Anthropic 的 Claude Opus 5 表现好坏参半,引领智能基准测试
Anthropic 发布了 Claude Opus 5,该模型正被集成到 Claude Code 等各种产品中。早期用户报告的体验好坏参半,一些人发现它具有高度的代理能力并能胜任复杂任务,而另一些人则称其“无知”且容易忽略指令或破坏工作流程。尽管一些用户感到沮丧,但 Opus 5 在人工智能分析智能指数中处于领先地位,在智能指标方面优于其他模型,尽管其成本效益正与 GPT-5.6 Sol 等竞争对手进行比较。
-
Anthropic 发布 Claude Opus 5,定价激进,竞争对手 OpenAI 即将 IPO
Anthropic 推出了 Claude Opus 5,一款在智能方面可与顶级竞争对手相媲美的新型 AI 模型,同时提供显著更低的价格,据报道是 Fable 5 等模型成本的 26%。此举被视为一项战略性商业攻势,尤其是在 Anthropic 传闻准备 IPO 的背景下。该公司还推出了 Ode,这是与 Blackstone 和 Hellman & Friedman 的合资企业,估值 15 亿美元,该企业以“Claude 优先”原则为核…