LatentMoE
PulseAugur coverage of LatentMoE — every cluster mentioning LatentMoE across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Kimi K3 揭示长上下文和代理任务的架构创新
Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…
-
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B 以支持 Blackwell 硬件
NVIDIA 发布了其 Nemotron-Labs-3-Puzzle-75B 模型,该模型已针对 Blackwell 硬件上的服务进行了优化。该模型集成了 LatentMoE、Mamba-Interleaving 和 Multi-Token Prediction (MTP) 以提高吞吐量。它在 OpenMDW-1.1 许可下可用,允许商业使用。
-
NVIDIA 发布高效 Nemotron 3 LLM 系列,采用混合架构
NVIDIA 发布了两款新的大型语言模型 Nemotron 3 Nano 和 Nemotron 3 Ultra,专注于效率和高级功能。Nemotron 3 Nano 是一款 30B 级模型,专为私有推理和代理工作流设计,采用混合 Mamba-Transformer Mixture-of-Experts 架构,并支持高达 100 万个 token 以实现长上下文应用。Nemotron 3 Ultra 是一款 550B 参数模型,采用类似…
-
Nemotron 3 Ultra:开源 LLM 拥有百万级上下文、6倍吞吐量
研究人员发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的语言模型,它采用了混合 Mamba-Transformer 架构和专家混合(Mixture-of-Experts)方法。该模型在 20 万亿个 token 上进行了训练,拥有百万级 token 的上下文长度,并采用了 LatentMoE 和 Multi Token Prediction 等先进技术。与当前最先进的模型相比,Nemotron 3 Ultra…
-
机器学习突破融合现有数学;消融研究验证模型
机器学习领域的最新讨论强调,突破源于现有数学概念的新颖组合和应用,而非全新的理论。LatentMoE、MLA、LoRA、SVD 和特征分解等技术体现了这种重新利用既有思想的趋势。此外,还强调了严格实验方法(如消融研究)的重要性,这些方法对于验证因果关系和分离变量至关重要,这对于模型改进和研究验证至关重要。
-
NVIDIA 发布 Nemotron-3 Ultra 550B LLM 以实现高级推理
NVIDIA 发布了其 Nemotron-3 Ultra 550B 模型,这是一个专为高级推理和代理工作流设计的大型语言模型。该模型采用混合 LatentMoE 架构,结合了 Mamba-2 和注意力层,支持高达 100 万个 token 的上下文长度。它针对多步代理、长上下文分析和多语言推理等复杂任务进行了优化,其推理能力可通过聊天模板进行配置。