DeepSeek 发布了其 DeepSeek-V4 系列的预览版本,其中包括两个混合专家(MoE)语言模型:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。这两个模型都支持令人印象深刻的百万 Token 上下文长度,并采用了混合注意力机制等架构升级以提高效率,以及流形约束超连接(mHC)以增强稳定性。这些模型可通过 Transformers、vLLM 和 SGLang 等各种库和推理提供商使用,并提供了集成说明。 AI
影响 这些模型在上下文长度和效率方面突破了界限,有可能在长上下文 AI 领域实现更复杂的应用和研究。
排序理由 前沿实验室模型发布,附带系统卡和技术细节。
在 Hugging Face Trending Models 阅读 →
- deepseek-ai/DeepSeek-V4-Pro-DSpark
- DeepSeek-V3.2
- DeepSeek V4
- DeepSeek-V4-Flash
- DeepSeek-V4-Pro
- Docker Model Runner
- Google Colab
- Kaggle
- SGLang
- transformers
- vLLM
- DeepSeek-V4-Flash-DSpark
- DeepSeek-V4-Pro-DSpark
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →