一款名为 Bongochat 的新开源模型已成为 GPQA-Dumb 类别(在此基准测试中,分数越低表示性能越好)的领导者。该模型使用 Claude Code 在 RTX 5070 上本地训练,并基于 Karpathy 的 nanochat,但存在明显局限性。它在执行基本任务时遇到困难,会重复单词,无法回答数学问题,并为简单的算术提供过于复杂的解决方案,同时还表现出缺乏记忆力和编码能力。 AI
影响 强调了对新颖基准测试的持续探索以及开源模型的快速迭代,即使是那些存在明显局限性的模型。
排序理由 该集群描述了一个新的开源模型发布及其在特定基准测试上的表现。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →