Artificial Analysis Intelligence Index
PulseAugur coverage of Artificial Analysis Intelligence Index — every cluster mentioning Artificial Analysis Intelligence Index across labs, papers, and developer communities, ranked by signal.
- instance of Kimi k3 90%
- instance of GLM-5.2 90%
- instance of Opus 4.8 90%
- instance of Claude Opus-5 90%
- instance of SpaceXAI 90%
- instance of Z Air 90%
- competes with GPT 5.6 "Sol" 70%
- instance of GPT 5.6 "Sol" 70%
- competes with Claude Opus-5 70%
- instance of Claude Fable-5 70%
- instance of Claude Opus 4-8 70%
- competes with Claude Opus 4-8 70%
7 天有情绪数据
-
网页绘制LLM API价格与价值图以寻找最佳模型
一个静态网页通过将其与API价格进行绘图来可视化各种大型语言模型的价值主张。“人工智能分析智能指数”页面每日更新,旨在帮助用户找到最适合其需求的LLM。
-
四款新的前沿人工智能模型在基准测试、成本和访问方面进行比较
四款新的前沿人工智能模型——Claude Fable 5.1、GPT-6 Astra、GPT-6.1 Sol 和 Gemini 4 Argon——在一个月内发布,各有独特的优势和定价结构。虽然基准测试分数显示出一些重叠,但每项任务的成本、缓存能力和访问策略的差异显著影响了它们对各种应用的适用性。OpenAI 因内部测试失败取消了 GPT-6.1 Astra,将 GPT-6 Astra 作为其当前顶级模型。Gemini 4 Argon …
-
分析发现最昂贵的AI模型并非最聪明 · 跟踪2个来源
一项近期对23个大语言模型的能力和API价格进行的比较分析显示,最昂贵的模型不一定是最聪明的。Epoch能力指数(ECI)被用来根据各种基准对模型进行评分,价格数据来源于截至2026年10月的API列表。研究发现,像Claude Opus 5.5和GPT-6 Astra这样的顶级模型虽然能力很强,但并非最具成本效益。像Claude Sonnet 5.5、Gemini 3.8 Flash和DeepSeek-V4 Flash这样更便宜但仍…
-
GPT-6 Luna 发布,价格减半,输出字数缩短
GPT-6 Luna 已发布,与前代 GPT-5.6 Luna 相比,成本显著降低。虽然在通用基准测试上的性能相当,但 GPT-6 Luna 在仅给出目标时会产生更短的输出,并且每项任务的成本效益更高。然而,这种简洁性可能导致遗漏,例如在事后复盘中省略事件持续时间,而 GPT-5.6 Luna 较少出现这种行为。当提供具体要求时,GPT-6 Luna 表现出更完整的输出,并且成本仍然显著降低。
-
Google DeepMind推出Gemini 4 Argon,支持100万token输出 · 已追踪8个来源
Google DeepMind宣布推出Gemini 4 Argon,这是一款专为编码、企业知识工作和网络安全等复杂工作流程设计的前沿AI模型。该模型拥有行业领先的100万token输出限制,并在多个基准测试中展现了最先进的性能,包括DeepSWE v1.1和Vals Index。Gemini 4 Argon最初将通过Fairwind计划向受信任的测试者推出,并在分阶段的安全测试和与美国政府的自愿预发布流程互动后,计划更广泛地提供。定价…
-
OpenAI 在 Anthropic 的 Claude 5.5 的激烈竞争下仓促推出 GPT-6.1 Sol 更新
OpenAI 在其 GPT-6 Sol 模型发布后不久,迅速推出了 GPT-6.1 Sol 的更新。此举似乎是对 Anthropic 最近发布的 Claude Opus 5.5 和 Sonnet 5.5 的直接回应,后者分别在复杂任务和日常使用方面设定了新的基准。随着两家实验室迅速迭代并相互比较各自的最新产品,竞争格局日益激烈。
-
K2 Horizon 7B模型展现出与其体量相符的强劲性能
K2 Horizon 7B模型已展现出强劲性能,在人工智能分析指数上排名介于Qwen 3.6 27B和Qwen 3.6 35BA3b模型之间。初步测试表明该模型表现稳健,考虑到其体量,其性能尤为令人印象深刻。该模型的GGUF版本可在Hugging Face上获取。
-
阿里巴巴的 Qwen3.8-27B 模型在 Cerebras 硬件上实现了具有竞争力的性能
阿里巴巴的 Qwen3.8-27B 模型现已在 Cerebras 硬件上运行,提供快速的推理能力。该开放权重模型在人工智能分析指数上获得了 34 分。这一性能使其能够与 GPT 5.6 Luna、DeepSeekv4 Pro 和 Claude Sonnet 4.6 等其他领先模型直接竞争。
-
DeepSeek 发布 V4.1-Flash,采用新颖架构实现高效 AI 代理
DeepSeek 发布了 V4.1-Flash,这是一款新的开源旗舰模型,采用了新颖的因果编码器-解码器架构。该模型强调极高的推理效率和成本效益,拥有 7630 亿参数,并为输入和输出处理分配了 8B/16B 参数。尽管未在所有基准测试中名列前茅,但其创新的上下文利用和高效的 KV 缓存使其特别适合长期运行的 AI 代理,标志着 DeepSeek 回归发布最先进的研究。
-
25亿参数MiniCPM5模型在基准测试中挑战更大模型
OpenBMB开发的MiniCPM5–2B模型代表了小型、高能力语言模型的一项重大进展。尽管其参数量为25亿,文件大小为1.04 GB,但在包括代码生成和工具调用任务在内的多项基准测试中,其表现优于Qwen3.5–4B和Nemotron-3-Nano-4B等更大模型。该模型令人印象深刻的智能密度挑战了‘更大参数量总是高性能所必需’的主流观点,使其成为生产环境甚至移动设备的可用选项。
-
分析称 OpenAI 的 GPT-6 Astra 在图形方面取得重大进展
Sebastian Raschka 的分析表明,OpenAI 的新 GPT-6 Astra 模型在图形任务方面比前代 GPT-5.6 "Sol" 有显著改进,并在 ARC-AGI-3 基准测试中取得了近乎完美的成绩。虽然 Astra 在数学和编码方面表现出色,但其在代理编码任务上的领先优势不那么明显,这可能归因于基准测试特定的训练。文章还深入探讨了“循环 Transformer”的概念及其与高级 AI 模型中“隐藏推理”的潜在联系。
-
谷歌发布快速迭代的 Gemini Flash 模型,旗舰模型却延迟
谷歌在短时间内发布了四款 Gemini Flash 模型,最新的 Gemini 3.8 Flash 在编码方面表现出色,并以更低的成本达到了更大模型的性能。谷歌将这种快速发布的速度作为其在递归自我改进(RSI)方面的进展证据,这是一种 AI 模型优化自身代码的技术。然而,该公司旗舰的 Gemini 3.5 Pro 模型仍未发布,这引发了对谷歌在 AI 发展前沿竞争能力的质疑。
-
Multiverse Computing推出Quasar 438B,欧洲领先的AI模型
Multiverse Computing推出了Quasar 438B,这是一款专为企业级代理和编码任务设计的新型大型语言模型。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上表现强劲,得分43,使其成为该基准测试中欧洲领先的AI模型。Quasar 438B还展现出具有竞争力的速度,在15.3秒内生成500个token,并在长上下文推理和代理编码评估方面表现出色。
-
智谱AI的GLM-5.3-Flash为代理提供了Claude Opus成本的1/40
智谱AI推出的开源模型GLM-5.3-Flash,比Claude Opus 4.8等竞争对手便宜得多,每个token的成本约为1/40。这种成本效益对于代理工作负载尤其重要,因为代理工作负载由于多次迭代、广泛的上下文和工具使用,本身就非常消耗token。该模型的大上下文窗口和原生多模态能力进一步增强了其在复杂任务中的经济可行性。
-
智谱AI发布GLM-5.3-Flash,商汤国产算力基础设施提供支持
智谱AI发布了其首个原生多模态模型GLM-5.3-Flash(320B-A18B),在人工智能分析指数上得分57,与Anthropic的Claude Opus 4.8持平。该模型专为低成本设计,并利用了智谱最新的30T Token多模态预训练语料库。商汤的大装置基础设施正在为该模型的发布提供大规模国产算力及Token服务,展示了中国制造硬件在先进AI推理方面的商业可行性和效率。
-
Z AI 发布 GLM-5.3-Flash,拥有 400k 上下文窗口
Z AI 开发的专有模型 GLM-5.3-Flash 已发布,拥有 400k token 的上下文窗口。该模型在人工智能分析指数上表现良好,得分 57,远高于同类模型的平均水平。该模型的定价具有竞争力,输入 token 每 100 万个成本为 0.15 美元,输出 token 每 100 万个成本为 0.50 美元。
-
GLM-5.3 在 AI 指数上与 Kimi K3 持平,等待完全发布 · 跟踪 2 个来源
Z.ai 的 GLM-5.3 模型在人工智能分析指数上获得了 60 分,与 Kimi K3 的表现持平。这比其前身 GLM-5.2 提高了 7 分。虽然该模型比竞争对手更便宜,但据报道其完全发布有所延迟。
-
GLM-5.3 (max) 在人工智能智能指数中获得 60 分,提供 100 万上下文窗口
GLM-5.3 (max) 在人工智能分析智能指数上进行了评估,得分 60,远高于同类模型 35 的中位数。该专有模型由 Z AI 开发,拥有 100 万个 token 的上下文窗口,并相对于其成本展现出强大的智能。虽然在评估期间生成了大量输出 token,但其输入和输出 token 的定价被认为是适中的。
-
阿里巴巴的 Qwen3.8-27B 性能媲美 GPT 5.6 Luna,可在本地运行
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个开放权重模型,在人工智能分析指数上获得了 52 分。据报道,该新模型在性能上媲美 GPT 5.6 Luna,同时还能够在包括通过 WebGPU 在浏览器中运行在内的用户设备上本地运行。
-
Qwen 3.8 27B 模型在 AI Index 上获得 52 分,与 GPT 5.6 Luna 持平 · 跟踪 8 个来源
Qwen 3.8 27B 模型在 Artificial Analysis 智能指数上获得了 52 分,与 GPT 5.6 Luna 持平,接近 GLM-5.2 和 DeepSeek V4 Pro 0813。该模型由 Alibaba Group 开发,是开源权重模型,支持文本和图像输入,拥有 256k 上下文窗口,并以其具有竞争力的价格和相对于其规模的强劲性能而闻名。它还被强调为能够进行多模态处理的推理模型。