Code Arena
PulseAugur coverage of Code Arena — every cluster mentioning Code Arena across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Code Arena 扩展以衡量全栈 AI 模型能力
Code Arena,一个新基准,现在正在评估 AI 模型的全栈能力。此次扩展旨在提供比传统指标更全面的 AI 性能评估。
-
Kimi K3模型标志着中国在全球人工智能竞争中达到新里程碑
中信证券的研究表明,Kimi K3模型代表了中国大型语言模型的一项重大进展,使其在全球舞台上具有竞争力。该模型拥有令人印象深刻的2.8万亿参数、100万的上下文窗口,并在智能体编码的Code Arena中表现出色,证明了其与美国领先模型竞争的能力。预计这将降低使用顶级模型的门槛和成本,惠及下游应用并开辟新的用例。
-
AI 模型在 Code Arena 排行榜上接受 Web 开发和代理编码评估
Code Arena Web 开发和代理编码工作流排行榜已根据 391,241 票评估了 90 个模型。表现最佳的模型包括 Anthropic 的 Claude Fable-5、智谱 AI 的 GLM-5.2、多个 Claude Opus 模型以及 OpenAI 的 GPT-5.5。该排行榜提供了关于 Elo 评分、投票数和每代币成本的比较数据,以评估代理 AI 的性能。
-
GLM-5.2 模型成功,Zhipu AI 市值突破 1 万亿港元 · 追踪 2 个来源
智谱 AI(又称“知识图谱科技”)的市值已超过 1 万亿港元(1280 亿美元),此前其股价大幅上涨。这一估值增长归因于投资者的乐观情绪以及其最近发布的开源 GLM-5.2 模型。GLM-5.2 模型拥有 100 万个 token 的上下文窗口,表现强劲,在前端 Web 开发任务的 Code Arena 榜单上排名全球第二,仅次于 Anthropic 的 Claude Fable 5。这一发展带来了乐观的收入预测,摩根大通预计 Zhi…
-
阿里巴巴的Qwen3.7-Max AI模型在全球编码基准测试中排名第四
阿里巴巴的新AI模型Qwen3.7-Max在Code Arena排行榜上名列第四,超越了OpenAI和Google的模型。这款专门的编码代理是唯一进入前五名的非美国开发的模型,其他名次则被Anthropic的Claude模型占据。Code Arena根据用户提示评估模型从零开始构建完整Web应用程序的能力,排名受到真实开发者偏好的影响。
-
阿里巴巴的 Qwen3.7-Max 在 AI 编程排行榜上名列全球第二
阿里巴巴的 Qwen3.7-Max 在 AI 编程能力方面取得了重要里程碑,在 Code Arena 排行榜上以 1541 分位居全球第二。这使其仅次于 Anthropic 的 Claude 系列,并领先于 GPT-5.5 和 Gemini-3.5-Flash 等知名模型。Code Arena 评估模型生成完整、交互式 Web 应用程序的能力,这与传统的编码基准测试不同。Qwen3.7-Max 的表现凸显了其在编码、智能体和长上下文任…