Alibaba的Qwen3.8-Max-0902模型在Code Arena的WebDev基准测试中取得了第一名,得分1,691分。该模型在成本效益的帕累托前沿也处于领先地位,定价为每百万token 5美元。这一表现使其超越了HY4 Preview等其他模型,并且显著低于Claude Opus的成本,从而使开发人员更容易获得先进的代理循环。 AI
影响 为编码基准测试中的成本效益表现树立了新标准,可能降低了高级AI代理部署的门槛。
排序理由 模型基准测试成就和成本效益分析。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →