一款新的大型语言模型 DeepSeek V4.1 Flash 已发布,其特定工作负载成本显著降低,在代理编码任务上比 Anthropic 的 Claude Opus 5 便宜约 36 倍。尽管其成本效益高且在 SWE Bench 等基准测试中表现相当,但在复杂推理和 ProgramBench 评估方面仍有不足。该模型的效率归因于其缩小的 KV 缓存大小,使得长上下文会话更具经济可行性。 AI
影响 此次发布显著降低了代理工作流的成本门槛,有望加速 AI 代理在编码及类似任务中的应用。
排序理由 前沿实验室模型发布,附带系统卡和成本比较。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Blackwell
- Claude Opus-5
- DeepSeek
- DeepSeek V4.1 Flash
- H200
- Hacker News
- Hugging Face
- MIT
- Nvidia
- ProgramBench
- SGLang
- Shanghai STAR Market
- vLLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →