PulseAugur
中
实时 22:01:43
实体 Code Arena

Code Arena

PulseAugur coverage of Code Arena — every cluster mentioning Code Arena across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_231912 ·

    中国AI模型在Code Arena基准测试中超越Claude

    一款中国AI模型在Code Arena基准测试中超越了Claude,标志着竞争格局的重大转变。这一成就值得注意,因为它代表了中国模型首次在这一特定编码基准测试中名列前茅。

  2. RESEARCH · CL_231095 ·

    Alibaba的Qwen3.8-Max-0902在Code Arena上名列前茅,代理循环成本降低4倍

    Alibaba的Qwen3.8-Max-0902模型在Code Arena的WebDev基准测试中取得了第一名,得分1,691分。该模型在成本效益的帕累托前沿也处于领先地位,定价为每百万token 5美元。这一表现使其超越了HY4 Preview等其他模型,并且显著低于Claude Opus的成本,从而使开发人员更容易获得先进的代理循环。

  3. RESEARCH · CL_217651 ·

    阿里巴巴的 Qwen 模型在人工智能研究和基准测试中获得关注

    阿里巴巴的 Qwen 模型在人工智能研究中的使用量不断增加,中文开源大语言模型在学术论文中的提及率显著上升。其中一个 Qwen 模型 Qwen3.8-27B 在其体量级别上,在 Code Arena 基准测试中取得了前十名的排名,展示了强大的性能。

  4. SIGNIFICANT · CL_214944 ·

    泄露的Qwen 4模型“korrine”目标是达到Fable 5、Mythos 5的性能

    一个泄露的模型,据称名为“korrine”并在Code Arena上进行测试,被认为是Qwen 4。该模型有望达到与Fable 5和Mythos 5相当的性能水平。

  5. TOOL · CL_172491 ·

    Code Arena 扩展以衡量全栈 AI 模型能力

    Code Arena,一个新基准,现在正在评估 AI 模型的全栈能力。此次扩展旨在提供比传统指标更全面的 AI 性能评估。

  6. SIGNIFICANT · CL_152151 ·

    Kimi K3模型标志着中国在全球人工智能竞争中达到新里程碑

    中信证券的研究表明,Kimi K3模型代表了中国大型语言模型的一项重大进展,使其在全球舞台上具有竞争力。该模型拥有令人印象深刻的2.8万亿参数、100万的上下文窗口,并在智能体编码的Code Arena中表现出色,证明了其与美国领先模型竞争的能力。预计这将降低使用顶级模型的门槛和成本,惠及下游应用并开辟新的用例。

  7. TOOL · CL_107328 ·

    AI 模型在 Code Arena 排行榜上接受 Web 开发和代理编码评估

    Code Arena Web 开发和代理编码工作流排行榜已根据 391,241 票评估了 90 个模型。表现最佳的模型包括 Anthropic 的 Claude Fable-5、智谱 AI 的 GLM-5.2、多个 Claude Opus 模型以及 OpenAI 的 GPT-5.5。该排行榜提供了关于 Elo 评分、投票数和每代币成本的比较数据,以评估代理 AI 的性能。

  8. SIGNIFICANT · CL_103258 ·

    GLM-5.2 模型成功,Zhipu AI 市值突破 1 万亿港元 · 追踪 2 个来源

    智谱 AI(又称“知识图谱科技”)的市值已超过 1 万亿港元(1280 亿美元),此前其股价大幅上涨。这一估值增长归因于投资者的乐观情绪以及其最近发布的开源 GLM-5.2 模型。GLM-5.2 模型拥有 100 万个 token 的上下文窗口,表现强劲,在前端 Web 开发任务的 Code Arena 榜单上排名全球第二,仅次于 Anthropic 的 Claude Fable 5。这一发展带来了乐观的收入预测,摩根大通预计 Zhi…

  9. RESEARCH · CL_54686 ·

    阿里巴巴的Qwen3.7-Max AI模型在全球编码基准测试中排名第四

    阿里巴巴的新AI模型Qwen3.7-Max在Code Arena排行榜上名列第四,超越了OpenAI和Google的模型。这款专门的编码代理是唯一进入前五名的非美国开发的模型,其他名次则被Anthropic的Claude模型占据。Code Arena根据用户提示评估模型从零开始构建完整Web应用程序的能力,排名受到真实开发者偏好的影响。

  10. RESEARCH · CL_51721 ·

    阿里巴巴的 Qwen3.7-Max 在 AI 编程排行榜上名列全球第二

    阿里巴巴的 Qwen3.7-Max 在 AI 编程能力方面取得了重要里程碑,在 Code Arena 排行榜上以 1541 分位居全球第二。这使其仅次于 Anthropic 的 Claude 系列,并领先于 GPT-5.5 和 Gemini-3.5-Flash 等知名模型。Code Arena 评估模型生成完整、交互式 Web 应用程序的能力,这与传统的编码基准测试不同。Qwen3.7-Max 的表现凸显了其在编码、智能体和长上下文任…