Together AI 在 DeepSWE 软件工程任务上对其 GLM-5.3 模型与 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5 进行了基准测试。GLM-5.3 表现出竞争力,在单次准确率上略微落后于 GPT-5.6 Sol,但在多次尝试和显著更低的成本下超越了它。与 Claude Fable 5 相比,GLM-5.3 在准确率上相当,但成本却低了五倍多,两种模型都表现出相似的失败模式和高度的任务一致性。 AI
影响 GLM-5.3 的表现表明,开放权重模型在软件工程等特定任务上正在缩小与前沿模型的差距,并提供了显著的成本优势。
排序理由 对多个 LLM 在特定任务上的比较基准测试。
在 X — Together (inference / OSS) 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →