PulseAugur
实时 10:47:14
实体 Nemotron-3 Super 120B-A12B

Nemotron-3 Super 120B-A12B

PulseAugur coverage of Nemotron-3 Super 120B-A12B — every cluster mentioning Nemotron-3 Super 120B-A12B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. COMMENTARY · CL_138069 ·

    用户详述在低规格硬件上运行大型LLM的经验

    一位用户分享了在有限硬件上运行大型语言模型(LLM)的经验,利用模型量化(Q3、Q2)和内存映射(mmap)等技术将参数卸载到NVMe存储。他们成功使用了Mixture-of-Experts(MoE)模型,如Deepseek-V4-Flash和Nemotron-3-Super-120B-A12B,实现了1.0-2.5 tokens/sec的令牌生成速度。这种方法被用于逆向工程和代码审计等任务,尤其是在云端LLM访问受限的地区。

  2. TOOL · CL_125490 ·

    HexGrid Cloud 为开放权重模型提供定制化 LLM GPU 基准测试服务

    HexGrid Cloud 提供在用户指定的 GPU 和配置上对开放权重 LLM 进行基准测试的服务。他们正在征集模型和硬件设置的建议,以测试其部署平台,重点关注适合单个 H200 GPU 内存的聊天/指令模型。测试结果将包括吞吐量、延迟和成本指标,并将与完整的配置细节一起公开分享,以确保可复现性。

  3. TOOL · CL_113882 ·

    Nemotron-3-Super-120B-A12B 采用 Mamba+MoE 架构实现 504K token 召回

    NVIDIA 的 Nemotron-3-Super-120B-A12B 模型,一种混合 Mamba 和 Mixture-of-Experts 架构,已展示出高达 504,000 token 的完美召回能力。与传统的 KV 缓存方法相比,该模型利用 Mamba 层来维持恒定的循环状态,显著降低了长上下文相关的计算成本。该模型在拥有约 71GB 显存的四块 3090 GPU 上运行,在扩展上下文长度时实现了令人印象深刻的解码速度,性能优于…

  4. FRONTIER RELEASE · CL_129798 ·

    NVIDIA发布压缩版Nemotron大语言模型,增强音频和推理能力 · 跟踪10个来源

    NVIDIA发布了基于其Nemotron架构的几款新模型,包括统一的音频-文本大语言模型Nemotron-Labs-Audex-2B和Nemotron-Labs-Audex-30B-A3B。此外,Nemotron-Labs-3-Puzzle-75B-A9B是Nemotron-3-Super-120B-A12B的部署优化压缩版本,旨在提高推理效率和吞吐量。这些模型正与LangChain和Fireworks等框架集成,以实现高级代理能力,…

  5. TOOL · CL_01116 ·

    AWS SageMaker AI 通过新的推理建议和 G7e 实例简化生成式 AI 部署

    Amazon SageMaker AI 推出了新功能,以简化生成式 AI 模型的部署。该平台现在提供优化的推理建议,利用 NVIDIA AIPerf 缩短了开发人员数周的手动基准测试过程。此外,AWS 推出了由 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 驱动的 G7e 实例,提供了更高的内存和网络吞吐量,从而实现更快、更具成本效益的大型语言模型推理。