PulseAugur
实时 09:48:51
Čeština(CS) Společnost DeepSeek zveřejnila 31. července 2026 model V4 Flash 0731 ve třech úrovních „reasoning“ nastavení (Low, High, Max), a výsledky na benchmarku ARC Priz

DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分

DeepSeek 发布了其 V4 Flash 0731 模型,该模型具有低、高和最大三种推理设置。该模型在 ARC Prize 基准测试中取得了令人印象深刻的分数,该测试用于评估人工智能系统的抽象推理能力。值得注意的是,在其最大设置下,V4 Flash 0731 在 ARC-AGI-1 上的得分为 89.0%,每次任务成本为 0.02 美元,在更具挑战性的 ARC-AGI-2 上的得分为 61.4%,每次任务成本为 0.04 美元。此次发布凸显了 DeepSeek 在以西方模型成本的一小部分提供竞争性性能方面持续的关注,该模型及其相关论文可在 Hugging FacearXiv 上获取。 AI

影响 在抽象推理基准测试中设定了新的 SOTA,提供了西方模型的经济高效替代方案。

排序理由 前沿实验室模型发布及基准测试结果。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 Mastodon — fosstodon.org 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试中取得高分

报道来源 [1]

  1. Mastodon — fosstodon.org TIER_1 Čeština(CS) · [email protected] ·

    DeepSeek 于 2026 年 7 月 31 日发布了 V4 Flash 0731 模型,提供三种“推理”设置(低、高、最大),并在 ARC Priz 基准测试中取得成果

    Společnost DeepSeek zveřejnila 31. července 2026 model V4 Flash 0731 ve třech úrovních „reasoning“ nastavení (Low, High, Max), a výsledky na benchmarku ARC Prize, který testuje schopnost obecné abstraktní usuzování u AI systémů, jsou působivé. Klíčová čísla: Na verzi ARC-AGI-1 do…