一位用户对几款 35B MoE 类的本地大型语言模型进行了真实编码基准测试,比较了 Qwen 3.6、Ornith 1.0 和 KAT Coder 2.5 Dev。虽然 Qwen 3.6 作为基线模型表现良好,但在较长任务中表现出自信幻觉和漂移的倾向。Ornith 1.0 尽管基准测试表现出色,但经常过度思考简单任务,并表现出与 Qwen 类似的推理循环问题。然而,KAT Coder 2.5 Dev 以更果断的输出、在实际编码场景中更好的表现以及更少的重复性问题给用户带来了惊喜,这标志着本地模型在严肃编码工作负载方面的实用性向前迈进了一步。 AI
影响 强调 KAT Coder 2.5 Dev 是一个有前途的本地模型,适用于严肃的编码任务,可能影响开发人员工具的选择。
排序理由 用户生成的用于编码任务的本地 LLM 比较,而非主要发布或研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →