PulseAugur
实时 12:09:01
实体 LatentMoE

LatentMoE

PulseAugur coverage of LatentMoE — every cluster mentioning LatentMoE across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. SIGNIFICANT · CL_167987 ·

    Kimi K3 揭示长上下文和代理任务的架构创新

    Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…

  2. FRONTIER RELEASE · CL_130046 ·

    NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B 以支持 Blackwell 硬件

    NVIDIA 发布了其 Nemotron-Labs-3-Puzzle-75B 模型,该模型已针对 Blackwell 硬件上的服务进行了优化。该模型集成了 LatentMoE、Mamba-Interleaving 和 Multi-Token Prediction (MTP) 以提高吞吐量。它在 OpenMDW-1.1 许可下可用,允许商业使用。

  3. SIGNIFICANT · CL_100955 ·

    NVIDIA 发布高效 Nemotron 3 LLM 系列,采用混合架构

    NVIDIA 发布了两款新的大型语言模型 Nemotron 3 Nano 和 Nemotron 3 Ultra,专注于效率和高级功能。Nemotron 3 Nano 是一款 30B 级模型,专为私有推理和代理工作流设计,采用混合 Mamba-Transformer Mixture-of-Experts 架构,并支持高达 100 万个 token 以实现长上下文应用。Nemotron 3 Ultra 是一款 550B 参数模型,采用类似…

  4. RESEARCH · CL_93241 ·

    Nemotron 3 Ultra:开源 LLM 拥有百万级上下文、6倍吞吐量

    研究人员发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的语言模型,它采用了混合 Mamba-Transformer 架构和专家混合(Mixture-of-Experts)方法。该模型在 20 万亿个 token 上进行了训练,拥有百万级 token 的上下文长度,并采用了 LatentMoE 和 Multi Token Prediction 等先进技术。与当前最先进的模型相比,Nemotron 3 Ultra…

  5. COMMENTARY · CL_81432 ·

    机器学习突破融合现有数学;消融研究验证模型

    机器学习领域的最新讨论强调,突破源于现有数学概念的新颖组合和应用,而非全新的理论。LatentMoE、MLA、LoRA、SVD 和特征分解等技术体现了这种重新利用既有思想的趋势。此外,还强调了严格实验方法(如消融研究)的重要性,这些方法对于验证因果关系和分离变量至关重要,这对于模型改进和研究验证至关重要。

  6. FRONTIER RELEASE · CL_71083 ·

    NVIDIA 发布 Nemotron-3 Ultra 550B LLM 以实现高级推理

    NVIDIA 发布了其 Nemotron-3 Ultra 550B 模型,这是一个专为高级推理和代理工作流设计的大型语言模型。该模型采用混合 LatentMoE 架构,结合了 Mamba-2 和注意力层,支持高达 100 万个 token 的上下文长度。它针对多步代理、长上下文分析和多语言推理等复杂任务进行了优化,其推理能力可通过聊天模板进行配置。