阿里巴巴新款开源模型 Qwen 3.8-27B 在 SWE-Bench Pro 基准测试中表现优于 Anthropic 的 Claude Opus 4.6 Max,得分分别为 61.7 和 53.4。这款拥有 270 亿参数的模型能够运行在单块 24GB GPU 上,并支持 262,000 个 token 的原生上下文窗口。Qwen 3.8-27B 以 Apache 2.0 许可证发布。 AI
影响 这一性能表现表明开源大语言模型领域竞争激烈,有望推动进一步的创新和普及。
排序理由 一家主要科技公司发布的新开源模型基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →