PulseAugur
中
实时 22:24:12
实体 LatentMoE

LatentMoE

PulseAugur coverage of LatentMoE — every cluster mentioning LatentMoE across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. SIGNIFICANT · CL_242565 ·

    NVIDIA 发布 Nemotron-3-Labs-Ultra-Math-RL 用于数学证明

    NVIDIA 发布了 Nemotron-3-Labs-Ultra-Math-RL,一个拥有 5500 亿参数(其中 550 亿活跃)的大型语言模型。该模型采用 LatentMoE 架构,专为数学证明而设计。在使用该模型进行集成时,它在 IMO 2026 基准测试中取得了金牌级成果,表现强劲。该模型可在 OpenMDW-1.1 许可下使用。

  2. COMMENTARY · CL_233064 ·

    NVIDIA 的 Nemotron3 Ultra 性能不及中国小型 AI 模型

    NVIDIA Research 开发了 LatentMoE 和 GatedDeltaNets 等先进技术,这些技术已被集成到 Kimi K3 和 Qwen 等模型中。然而,该公司的内部流程导致发布了性能不佳的模型,如 Nemotron3 Ultra。这个拥有 550B 参数的模型,其性能不如包括仅有 27B 参数的 Qwen3.8 在内的中国小型模型,凸显了前沿训练能力方面的显著差距。

  3. FRONTIER RELEASE · CL_201322 ·

    NVIDIA发布具有100万上下文的Nemotron-Labs-Teacher模型 · 跟踪4个来源

    NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。

  4. SIGNIFICANT · CL_186255 ·

    Kimi K3 采用 896 个专家和混合注意力机制实现高效扩展

    Kimi K3 是一个拥有 2.8 万亿参数的模型,它采用了一种新颖的方法来管理其庞大的规模,即每个 token 只激活 896 个路由专家中的 16 个。研究员苏剑林详细介绍了这一策略,旨在控制计算成本,尽管参数量和上下文长度有所增加。该模型集成了 LatentMoE 以减少专家计算和通信,并结合了 RMSNorm 和 SiTU-GLU 等机制,以在低精度训练期间保持数值稳定性。其注意力架构结合了 KDA 用于连续状态维护和 MLA…

  5. COMMENTARY · CL_171584 ·

    理解 Moonshot AI 的 Kimi K3 模型架构指南

    一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…

  6. SIGNIFICANT · CL_167987 ·

    Kimi K3 揭示长上下文和代理任务的架构创新

    Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…

  7. FRONTIER RELEASE · CL_130046 ·

    NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B 以支持 Blackwell 硬件

    NVIDIA 发布了其 Nemotron-Labs-3-Puzzle-75B 模型,该模型已针对 Blackwell 硬件上的服务进行了优化。该模型集成了 LatentMoE、Mamba-Interleaving 和 Multi-Token Prediction (MTP) 以提高吞吐量。它在 OpenMDW-1.1 许可下可用,允许商业使用。

  8. SIGNIFICANT · CL_100955 ·

    NVIDIA 发布高效 Nemotron 3 LLM 系列,采用混合架构

    NVIDIA 发布了两款新的大型语言模型 Nemotron 3 Nano 和 Nemotron 3 Ultra,专注于效率和高级功能。Nemotron 3 Nano 是一款 30B 级模型,专为私有推理和代理工作流设计,采用混合 Mamba-Transformer Mixture-of-Experts 架构,并支持高达 100 万个 token 以实现长上下文应用。Nemotron 3 Ultra 是一款 550B 参数模型,采用类似…

  9. RESEARCH · CL_93241 ·

    Nemotron 3 Ultra:开源 LLM 拥有百万级上下文、6倍吞吐量

    研究人员发布了 Nemotron 3 Ultra,这是一个拥有 5500 亿参数的语言模型,它采用了混合 Mamba-Transformer 架构和专家混合(Mixture-of-Experts)方法。该模型在 20 万亿个 token 上进行了训练,拥有百万级 token 的上下文长度,并采用了 LatentMoE 和 Multi Token Prediction 等先进技术。与当前最先进的模型相比,Nemotron 3 Ultra…

  10. COMMENTARY · CL_81432 ·

    机器学习突破融合现有数学;消融研究验证模型

    机器学习领域的最新讨论强调,突破源于现有数学概念的新颖组合和应用,而非全新的理论。LatentMoE、MLA、LoRA、SVD 和特征分解等技术体现了这种重新利用既有思想的趋势。此外,还强调了严格实验方法(如消融研究)的重要性,这些方法对于验证因果关系和分离变量至关重要,这对于模型改进和研究验证至关重要。

  11. FRONTIER RELEASE · CL_71083 ·

    NVIDIA 发布 Nemotron-3 Ultra 550B LLM 以实现高级推理

    NVIDIA 发布了其 Nemotron-3 Ultra 550B 模型,这是一个专为高级推理和代理工作流设计的大型语言模型。该模型采用混合 LatentMoE 架构,结合了 Mamba-2 和注意力层,支持高达 100 万个 token 的上下文长度。它针对多步代理、长上下文分析和多语言推理等复杂任务进行了优化,其推理能力可通过聊天模板进行配置。