DeepSeek 发布了其旗舰 AI 模型 DeepSeekV4Pro 0813 的更新版本。虽然该模型在网络安全任务方面表现出优势,但在与 GPT-5.6 和 Kimi K3 等竞争对手的几项基准测试中表现不佳。该模型在沙盒环境和生成复杂的金融模型方面也面临挑战。 AI
影响 新模型发布表现好坏参半,凸显了在基准测试任务中需要改进的领域。
排序理由 Frontier-lab 模型发布,附带系统卡。[lever_c_降级自 frontier_release: ic=1 ai=1.0]
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →