PulseAugur
实时 19:29:19

DeepSeek 发布 V4 模型,支持百万 Token 上下文并采用 MoE 架构 · 跟踪 3 个来源

DeepSeek 发布了其 DeepSeek-V4 系列的预览版本,其中包括两个混合专家(MoE)语言模型:DeepSeek-V4-ProDeepSeek-V4-Flash。这两个模型都支持令人印象深刻的百万 Token 上下文长度,并采用了混合注意力机制等架构升级以提高效率,以及流形约束超连接(mHC)以增强稳定性。这些模型可通过 TransformersvLLMSGLang 等各种库和推理提供商使用,并提供了集成说明。 AI

影响 这些模型在上下文长度和效率方面突破了界限,有可能在长上下文 AI 领域实现更复杂的应用和研究。

排序理由 前沿实验室模型发布,附带系统卡和技术细节。

在 Hugging Face Trending Models 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

DeepSeek 发布 V4 模型,支持百万 Token 上下文并采用 MoE 架构 · 跟踪 3 个来源

报道来源 [3]

  1. Hugging Face Trending Models TIER_1 Nederlands(NL) · deepseek-ai ·

    deepseek-ai/DeepSeek-V4-Pro-DSpark

    text-generation · 0 downloads · 70 likes

  2. Hugging Face Trending Models TIER_1 Nederlands(NL) · deepseek-ai ·

    deepseek-ai/DeepSeek-V4-Flash-DSpark

    text-generation · 0 downloads · 49 likes

  3. r/LocalLLaMA TIER_1 Nederlands(NL) · /u/External_Mood4719 ·

    deepseek-ai/DeepSeek-V4-Pro-DSpark Huggingface

    <!-- SC_OFF --><div class="md"><p><a href="https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark">https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark</a></p> <p><a href="https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf">https://github.com/deepseek-ai/D…