DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此次发布凸显了 DeepSeek 在以西方模型成本的一小部分提供竞争性性能方面持续的关注,该模型及其相关论文可在 Hugging Face 和 arXiv 上获取。 AI
影响 在抽象推理基准测试中设定了新的 SOTA,提供了西方模型的经济高效替代方案。
排序理由 前沿实验室模型发布及基准测试结果。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →