PulseAugur
实时 01:34:52
English(EN) Kimi K3 Beat Fable 5 and GPT-5.6 Sol at Frontend Code — Then I Found the 51% Hallucination Rate

Kimi K3 在编码基准测试中名列前茅,但幻觉率很高

Moonshot AIKimi K3 模型在 Arena.ai 的前端代码竞技场中名列前茅,超越了 Claude Fable 5GPT-5.6 Sol。这款拥有 2.8 万亿参数的开放权重模型即将公开发布下载。然而,一项分析显示 Kimi K3 的幻觉率显著增加,从其前代的 39% 上升到 51%,表明它生成的内容更多,但虚构的内容也更多。 AI

影响 为前端编码任务设定了新的基准,但由于幻觉率高而引发了对可靠性的担忧。

排序理由 Frontier-lab 模型发布,具有基准性能和报告的幻觉率。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 Towards AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Kimi K3 在编码基准测试中名列前茅,但幻觉率很高

报道来源 [1]

  1. Towards AI TIER_1 English(EN) · Chew Loong Nian - AI ENGINEER ·

    Kimi K3 在前端代码方面击败 Fable 5 和 GPT-5.6 Sol — 然后我发现了 51% 的幻觉率

    <div class="medium-feed-item"><p class="medium-feed-image"><a href="https://pub.towardsai.net/kimi-k3-beat-fable-5-and-gpt-5-6-sol-at-frontend-code-then-i-found-the-51-hallucination-rate-375295a34344?source=rss----98111c9905da---4"><img src="https://cdn-images-1.medium.com/max/14…