字节跳动的 Seed 团队发现 DeepSeek-V4 模型存在周期性性能问题,模型的准确性会根据输入 token 的位置而波动。这种“相位敏感性”与 DeepSeek 的块 KV 缓存压缩技术有关,该技术旨在提高长上下文的效率。研究人员发现,根据信息在压缩上下文窗口中的位置,模型回忆信息的能力会因压缩率不同而变化超过 40 个百分点,周期长度与压缩步长相关。 AI
影响 强调了长上下文优化技术中潜在的陷阱,表明需要超越平均性能进行更细致的评估。
排序理由 研究论文详细介绍了模型因优化技术而出现的特定性能问题。[lever_c_demoted from research: ic=1 ai=1.0]
- ByteDance
- DeepSeek
- DeepSeek-V4
- DeepSeek-V4.1-Flash-0910
- DeepSeek-V4-Flash-0731
- DeepSeek-V4-Flash-Base
- DeepSeek-V4-Pro-Base
- Qwen3 0.6B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →