Moonshot AI 的 Kimi K3 模型在 Arena.ai 的前端代码竞技场中名列前茅,超越了 Claude Fable 5 和 GPT-5.6 Sol。这款拥有 2.8 万亿参数的开放权重模型即将公开发布下载。然而,一项分析显示 Kimi K3 的幻觉率显著增加,从其前代的 39% 上升到 51%,表明它生成的内容更多,但虚构的内容也更多。 AI
影响 为前端编码任务设定了新的基准,但由于幻觉率高而引发了对可靠性的担忧。
排序理由 Frontier-lab 模型发布,具有基准性能和报告的幻觉率。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →