DeepSeek-V4 Flash 0731 在 GPQA 基准测试中取得了 90.8% 的分数,在 HLE 上取得了 38.6% 的分数。该模型还展示了每秒 233.8 个 token 的速度。值得注意的是,它提供了高智能成本比,每美元提供 52.3 个智能点,在大型语言模型领域中成为一个高效的选择。 AI
影响 在大型语言模型基准测试中展示了竞争力的性能和效率。
排序理由 发布了模型基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →