PulseAugur
实时 05:36:35
Deutsch(DE) RT @jun_song: Ich habe DeepSeek-V4-Pro-0813 und Grok-4.6 auf meiner Agenten-Framework getestet. Die Leistung enttäuscht etwas im Vergleich zu den Benchmarks (ge

DeepSeek V4 Pro 在推理方面表现出色,但在实际代理任务中结果喜忧参半

DeepSeek 的 V4 Pro 模型在推理性能方面表现出色,缓存命中率达到 96.56%,显著优于其他模型。在代理框架上进行测试时,DeepSeek-V4-Pro-0813Grok-4.6 的表现与基准测试相比有些令人失望,但仍优于目前受计算资源限制的 Anthropic 的 Opus-5AI

影响 凸显了大型语言模型在基准性能与实际应用之间的差距。

排序理由 该集群讨论了 AI 模型的性能基准测试和实际任务测试,属于研究类别。

在 Mastodon — fosstodon.org 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

DeepSeek V4 Pro 在推理方面表现出色,但在实际代理任务中结果喜忧参半

报道来源 [2]

  1. Mastodon — fosstodon.org TIER_1 Deutsch(DE) · [email protected] ·

    RT @thdxr: DeepSeek 在推理方面表现出色——它们的缓存命中率达到 96.56%,而我们第二好的提供商仅为 91.60%

    RT @thdxr: DeepSeek ist bei der Inferenz wahnsinnig gut – sie erreichen ein Cache-Verhältnis von 96,56 %, während unser zweitbester Anbieter nur 91,60 % schafft. Das mag nicht viel erscheinen, bedeutet aber, dass sie etwa die Hälfte der GPU-Zeit weniger benötigen. mehr auf Arint.…

  2. Mastodon — fosstodon.org TIER_1 Deutsch(DE) · [email protected] ·

    RT @jun_song: 我在我的代理框架上测试了 DeepSeek-V4-Pro-0813 和 Grok-4.6。与基准测试相比,性能有些令人失望(ge

    RT @jun_song: Ich habe DeepSeek-V4-Pro-0813 und Grok-4.6 auf meiner Agenten-Framework getestet. Die Leistung enttäuscht etwas im Vergleich zu den Benchmarks (getestet auf realen agentic Tasks, nicht auf Flappy Bird). Dennoch liegen sie immer noch weit vor Opus-5, das aufgrund von…