一项名为“NanoGPT Speedrun Frontier”的最新基准测试,评估了 18 种不同的前沿 AI 模型在使用 NanoGPT 优化器时的性能。该研究进行了 153 次自主运行,根据模型在设定资源预算内的最佳验证结果进行比较。Fable 5 表现最佳,完成了 81.7%,其次是 Claude Code (Opus) 和 Kimi K3。 AI
影响 该基准测试提供了前沿 AI 模型在编码任务上的比较性能数据,为未来的开发和选择提供参考。
排序理由 该集群报告了多个 AI 模型在特定任务上的基准评估,这是一种研究形式。
在 Mastodon — fosstodon.org 阅读 →
- nanoGPT
- Prime Intellect Novel
- Claude Code
- DeepSeek V4-Pro
- GLM-5.2
- GPT-5.6 Luna
- GPT-5.6 Sol
- GPT-5.6 Terra
- Grok 4.5
- Kimi K3
- Opus
- Opus 4.8
- Sonnet 5
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →