实体
DeepSeek MLA
DeepSeek MLA
PulseAugur coverage of DeepSeek MLA — every cluster mentioning DeepSeek MLA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
DeepSeek V4需要70GB KV缓存以支持100万token上下文
DeepSeek最新模型DeepSeek V4需要高达70GB的KV缓存来处理100万token的上下文窗口。虽然V4的具体配置尚未公开,但V3模型的细节揭示了处理如此大上下文长度所带来的显著GPU内存需求。
-
百度发布适用于XPU硬件的vLLM昆仑插件
百度发布了vLLM昆仑,这是一个社区维护的插件,使vLLM推理引擎能够在昆仑XPU硬件上运行。该集成允许在昆仑硬件上无缝执行各种开源LLM,包括基于Transformer的模型、混合专家(MoE)模型、嵌入式模型和多模态模型。该插件支持广泛的模型和功能,如量化、LoRA微调、优化注意力机制、推测性解码和张量并行,同时还提供了一个兼容OpenAI的API用于模型服务。