阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。 AI
影响 在智能体基准测试中设定了新的SOTA(State-of-the-Art),展示了强大的本地模型能力,并推动了云模型性能。
排序理由 前沿实验室模型发布,附带系统卡和基准测试结果。[lever_c_从frontier_release降级:ic=2 ai=1.0]
- Qwen3.8-27B
- Agents Last Exam
- Alibaba Group
- AndroidWorld
- Anthropic
- CoWorkBench
- LiveCodeBench v6
- Opus4.6 Max
- OSWorld
- Qwen
- RecreationBench
- SWE Bench Pro
- WebArena
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →