Artificial Analysis
PulseAugur coverage of Artificial Analysis — every cluster mentioning Artificial Analysis across labs, papers, and developer communities, ranked by signal.
- instance of Qwen-Audio-3.0-TTS-Plus 95%
- developed Optima 95%
- instance of Fun-Realtime-TTS 95%
- instance of GLM-5.2 90%
- instance of SpaceXAI 90%
- used by Fireworks AI 90%
- developed Intelligence indexes generalist genes for cognitive abilities 90%
- instance of Qwen3.8 Max 90%
- used by qwen3.8 27b 90%
- instance of Qwen-Audio-3.0-TTS 90%
- instance of MiniMax M2.7 80%
- instance of Kimi k3 70%
- 2026-06-16 research_milestone Artificial Analysis released an updated version of its Intelligence Index, version 4.1, which includes a greater emphasis on agentic workloads and improved benchmarks. 来源
27 天有情绪数据
-
企业因价格原因对Anthropic的高端模型犹豫不决,倾向于更便宜的替代品
企业支付Anthropic最先进模型Claude Fable-5的意愿不高。根据企业卡公司Ramp的数据,尽管Fable-5是Anthropic表现最好的模型,但在7月份,它仅占代币总数的6%,支出总额的11.4%,远低于OpenAI的GPT 5.6 "Sol"。这表明,性能优越就能自动获得更高价格的假设可能存在局限性,因为企业更看重成本效益而非绝对最佳的模型。
-
Gemini 3.7 Flash 在 OpenRouter 上价格减半 75%,超越 DeepSeek
Google 的 Gemini 3.7 Flash 模型在 OpenRouter 上的价格大幅降低,优惠 75%。根据 Artificial Analysis 的数据,此次降价使其更具竞争力,在性价比方面超越了 DeepSeek 模型。此举也可能符合 Google 为未来模型训练收集更多真实世界代理痕迹的利益。
-
Hugging Face 量化 ASR 基准优化,发现模型会复现错误
Hugging Face 的研究人员开发了新的方法来量化语音识别模型中的“基准优化”或“benchmaxxing”。他们的研究评估了 11 个开源 ASR 模型,发现几个高分系统会复现错误的基准转录,即使音频与转录内容相矛盾。这表明模型可能通过声学线索学习识别特定基准,而不是准确地转录语音,从而导致性能得分虚高。
-
Cartesia的Sonic-3.6模型位居AI排行榜榜首;Mistral AI建设欧洲基础设施 · 跟踪2个来源
Cartesia的Sonic-3.6模型在Artificial Analysis上取得了顶级排名,其状态空间模型架构的表现优于主要行业参与者,并实现了低于90毫秒的延迟。与此同时,法国公司Mistral AI正专注于数据主权,并开发1吉瓦的基础设施,以减少欧洲对美国科技巨头的依赖。
-
Google 发布 Gemini 3,声称拥有世界第一的 AI 模型地位 · 跟踪到 2 个来源
Google 发布了其新的前沿模型 Gemini 3,该模型声称在全球智能方面名列前茅。据 Artificial Analysis 称,Gemini 3 的得分达到 73,超过了 OpenAI、Anthropic 和 xAI 的模型。新模型包括 Pro、用于推理的 Deep Think 以及用于多步任务的 Gemini Agent。
-
AI代码版权引发争议,GLM-5.3基准测试出现 · 追踪3个来源
AI生成代码的所有权和版权正受到质疑,有观点认为,没有人类作者的代码可能不符合版权保护的资格。这一讨论源于AI在代码生成中日益普及及其对知识产权的法律影响。另外,GLM-5.3模型的基准测试已发布,对其性能进行了分析。
-
GLM-5.3 在人工分析基准测试中得到评估
GLM-5.3 模型已在人工分析基准测试中得到评估,结果发布在 artificialanalysis.ai 上。基准测试涵盖了模型的各个性能方面,提供了对其能力的见解。
-
阿里巴巴的Qwen3.8-27B模型在基准测试中可与OpenAI和Anthropic媲美
阿里巴巴发布了其Qwen3.8-27B,一个轻量级的大型语言模型,其性能与更大、更成熟的模型相比具有竞争力。基准测试表明,Qwen3.8-27B的性能与OpenAI的GPT-5.6 Luna相当,并与DeepSeek的产品非常接近。根据Artificial Analysis的数据,该模型在特定的代理工作流测试中也优于OpenAI的Terra和Anthropic的Claude Opus 4.8。Qwen3.8-27B是一个开放权重模型,…
-
AI开发将重点从模型转向“线束”基础设施
人工智能发展的普遍叙事正从仅关注模型能力转向强调围绕其基础设施的重要性,这通常被称为“线束”。这个线束包括重试逻辑、内存系统、工具路由和上下文管理等要素,这些对于现实世界中代理的性能至关重要。埃隆·马斯克关于Grok 4.6的最新承认以及Anthropic的Boris Cherny对Claude Code的实验都表明,模型的有效性与其运行环境紧密交织。GitHub等平台上的趋势进一步表明了代理基础设施发展的分歧,这表明“线束”正成为可…
-
Qwen3.8 27B AI模型在Artificial Analysis基准测试中获得52分
一款名为Qwen3.8 27B的新AI模型在Artificial Analysis基准测试中获得了52分。该模型的速度和成本性能指标目前列为未知或不适用。
-
Qwen3.8-27B 模型接近前沿性能,可与 DeepSeek V4 和 GPT-5.6 Luna MAX 媲美
Artificial Analysis 发布了其 Qwen3.8-27B 模型的基准测试结果,显示其性能可与 DeepSeek V4 和 GPT-5.6 Luna MAX 相媲美。这表明 Qwen3.8-27B 是一个能力很强的模型,接近前沿性能水平。基准测试还强调,这类先进模型现在可以在消费级硬件上运行,例如 RTX 3090,使其更易于获取。
-
Qwen 3.8 27B 模型在 AI Index 上获得 52 分,与 GPT 5.6 Luna 持平 · 跟踪 8 个来源
Qwen 3.8 27B 模型在 Artificial Analysis 智能指数上获得了 52 分,与 GPT 5.6 Luna 持平,接近 GLM-5.2 和 DeepSeek V4 Pro 0813。该模型由 Alibaba Group 开发,是开源权重模型,支持文本和图像输入,拥有 256k 上下文窗口,并以其具有竞争力的价格和相对于其规模的强劲性能而闻名。它还被强调为能够进行多模态处理的推理模型。
-
Qwen 模型基准测试引发关于 Artificial Analysis 覆盖范围的争论
r/LocalLLaMA 的用户正在讨论在 Artificial Analysis 平台上对 Qwen 模型进行基准测试的情况。一位用户报告了 Qwen3.8 27B 的惊人结果,而另一位用户则质疑 Qwen 32B 和其他知名本地模型基准测试的缺失。这引发了关于 Artificial Analysis 的选择标准和感知偏见的更广泛讨论,用户正在寻求更中立、更可靠的替代方案来跟踪模型性能。
-
新的 AI 平台在牙买加、菲律宾以及用于自定义基准测试的平台推出
三个不同的 AI 相关平台近期已推出,每个平台都有独特的侧重点。在牙买加,一个新的 AI 平台在国家人工智能工作组就该国 AI 政策进行公开磋商之前进入市场。另外,菲律宾技术专家 Karlo Dizon 开发了 Kartilya.PH,这是一个免费的菲律宾法律材料研究档案库,并配备了 AI 搜索引擎。此外,Artificial Analysis 发布了 Optima,一个允许用户使用自己的数据和工作流程构建个性化 AI 基准测试的平台。
-
Optima 平台推出,可在自定义业务数据上对 AI 模型进行基准测试
Artificial Analysis 推出了 Optima,一个旨在解决当前 AI 基准测试方法不足的新平台。Optima 允许企业使用自有数据和工作流程创建自定义基准测试,从而根据特定任务的模型质量、成本和速度进行比较。这种方法旨在为 AI 模型在实际业务应用中的性能提供更现实的评估,特别是对于基于代理的系统。
-
扩散式大语言模型Mercury 2在SDLC任务中表现不佳,尽管速度很快
最近的一项实验在Ship-Bench SDLC基准上评估了Inception Labs的基于扩散的LLM Mercury 2。尽管速度惊人且提供慷慨的免费套餐,Mercury 2在实施和验证任务方面却遇到了显著困难,在这些阶段得分很低。虽然该模型在上游文档阶段(如架构和规划)表现尚可,但产生的薄弱产物导致了下游失败,实施阶段破坏了核心用户流程。作者认为,像Mercury 2这样的扩散模型最适合速度敏感、低推理的任务,正如Incepti…
-
AI语音技术从研究走向实际应用
人工智能语音技术的最新进展在多个领域得到体现,从语音克隆和检测的学术研究到联络中心和个性化学习伴侣的实际应用。一篇arXiv上的调查论文详细介绍了AI生成语音及其检测的复杂性,并指出了诸如冒充和虚假信息等风险。与此同时,Cartesia的Sonic-3.6 TTS模型在语音排行榜上名列前茅,提供低延迟的实时合成。包括ShikshaMitra AI、RupeeGPT、Aarogyam、Sydney和EduGuideAI在内的多个项目,展…
-
xAI 发布 Grok 4.6,增强了代理功能 · 跟踪 2 个来源
xAI 推出了 Grok 4.6,这是 Grok 4.5 的高级继任者,专为复杂、长期任务而设计。这个新模型在交互式和可视化工作中表现出色,包括研究、数据分析和完整的代码库管理,旨在将想法转化为功能性应用程序。Artificial Analysis 的基准测试显示,Grok 4.6 在 AA Intelligence Index 上得分 61,与 GPT-5.6 Sol Max 相当,略微落后于 Fable 5 Max,但显著优于其前…
-
VUI Labs的Luna-TTS在TTS基准测试中全球领先,超越ElevenLabs
中国人工智能初创公司VUI Labs凭借其Luna-TTS模型在全球文本转语音(TTS)基准测试中取得了顶级排名。该模型在Hugging Face的TTS Arena上名列第一,超越了ElevenLabs和Minimax等竞争对手。Luna-TTS在Artificial Analysis的Speech Arena上也获得了第三名,表现优于Google的产品。
-
人工智能格局概述:模型提供商与规格对比
本条目概述了当前的人工智能格局,详细介绍了各种模型提供商并比较了它们的规格。它旨在全面了解人工智能行业及其提供的产品。