Nemotron 3 Super
PulseAugur coverage of Nemotron 3 Super — every cluster mentioning Nemotron 3 Super across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
英伟达的 Nemotron 3.5 Lightning 在成本和速度上引领 LLM 代理基准测试
最近的一项基准测试评估了八个大型语言模型 (LLM) 在处理虚构大学代理场景方面的能力,重点关注拒绝虚假信息和生成有效的 JSON 输出。结果表明,虽然所有模型在直接问答任务上表现良好,但在模型被要求拒绝回答或生成结构化数据时出现了显著差异。英伟达的 Nemotron 3.5 Lightning 在成本效益和速度方面表现最佳,在这些指标上显著优于 GPT-5.5 和 Opus 等闭源前沿模型。
-
NVIDIA 发布 Nemotron 3.5 Lightning 以执行 AI 代理
NVIDIA 发布了 Nemotron 3.5 Lightning,这是一个开放的 30B Mixture-of-Experts 模型,针对 AI 代理的执行层进行了优化。该模型仅有 3B 激活参数,专为工具调用、输出验证和代码格式化等高频操作任务而设计,为这些特定功能提供了比大型模型更低延迟和更低成本的替代方案。Nemotron 3.5 Lightning 可在 AIHubMix 平台上免费使用,支持高达 100 万个 token …
-
GPT-OSS 模型迎来一周年,被誉为顶级本地大模型
开源模型 gpt-oss 已迎来一周年纪念日,用户称赞其 20B 和 120B 版本为顶级本地模型。虽然 Qwen 3.5 122B 被认为是其主要竞争对手,但 gpt-oss 以其速度和对本地友好的量化格式而闻名。用户还分享了一个改进的 gpt-oss Jinja 模板,旨在修复问题并增强其功能。
-
Aether-7B-5Attn 以完全透明引领真正开放的大型语言模型
VIDRAFT 的 Aether-7B-5Attn,一个 7B 的专家混合模型,已被添加到 awesome-free-models 列表,使其区别于其他“开放”模型。与通常只提供训练参数的“开放权重”模型不同,Aether-7B-5Attn 通过其权重、数据、代码和训练日志提供了完全的透明度。这种在 Apache 2.0 许可下的完全开放,允许可复现性、可审计性和更大的用户主权,这对于基础模型至关重要。
-
Amazon SageMaker 为 NVIDIA Nemotron 3 LLM 增加无服务器微调功能
Amazon SageMaker AI 现在为 NVIDIA 的 Nemotron 3 系列开放权重大型语言模型提供无服务器模型定制。此功能允许企业使用监督微调 (SFT) 和强化学习等技术微调 Nemotron 3 Nano 和 Nemotron 3 Super 等模型,而无需管理基础设施。Nemotron 3 架构结合了 Mamba-Transformer 专家混合层,可实现高效的序列处理和参数激活,从而以更低的计算成本实现高吞吐量和准确性。
-
NVIDIA压缩Nemotron-3大语言模型,吞吐量提升2倍,100万token并发提升8倍
NVIDIA研究人员开发了Nemotron-Labs-3-Puzzle-75B-A9B,这是其Nemotron-3-Super大语言模型的压缩版本。该新变体显著提高了部署效率,在8xB200节点上实现了高达2倍的服务器吞吐量,并在单个H100 GPU上实现了高达8个并发100万token请求。通过结合迭代式Puzzle压缩、知识蒸馏和量化等技术的阶段性流水线实现了压缩,同时在很大程度上保留了模型在下游任务中的准确性。
-
LLM定价波动:NVIDIA、Qwen和Z.ai价格调整;新增模型 · 追踪10个来源
Token Ledger 发布了 2026 年 8 月初 LLM 定价变化的每日更新。包括 NVIDIA Nemotron 3 Super 和 Ultra、Qwen 变体以及 Z.ai 的 GLM 5.2 在内的几款模型价格进行了调整,报告显示有涨有跌。新增了 Meta 的 Muse Spark 1.2 和 inclusionAI 的 Ling-3.0-flash 等新模型,同时一些知名模型如 Gemini、Claude 和 GPT-…
-
Fireworks AI 为 NVIDIA Nemotron 3 模型启用 RL 微调
Fireworks AI 推出了新功能,支持对 NVIDIA 的 Nemotron 3 模型进行强化学习 (RL) 微调,首批支持 Nemotron 3 Super,并使用 LoRA 和 GRPO 方法。这个集成平台允许用户在同一地点训练和部署模型,定价基于 GPU 小时使用量而非 token 数量,以管理长时间交互的成本。
-
NVIDIA发布压缩版Nemotron大语言模型,增强音频和推理能力 · 跟踪10个来源
NVIDIA发布了基于其Nemotron架构的几款新模型,包括统一的音频-文本大语言模型Nemotron-Labs-Audex-2B和Nemotron-Labs-Audex-30B-A3B。此外,Nemotron-Labs-3-Puzzle-75B-A9B是Nemotron-3-Super-120B-A12B的部署优化压缩版本,旨在提高推理效率和吞吐量。这些模型正与LangChain和Fireworks等框架集成,以实现高级代理能力,…
-
Ollama 列出支持云的模型,包括 minimax-m3 和 nemotron-3
Ollama 发布了可在云平台上使用的模型列表。可用模型包括 minimax-m3、nemotron-3-ultra、gemma4:31b-cloud、nemotron-3-super 和 minimax。
-
AI社区质疑为何缺乏新的100B-120B参数语言模型
r/LocalLLaMA subreddit上的一项讨论突显了社区对100B-120B参数范围内新大型语言模型缺乏的看法。虽然之前存在GPT-OSS-120B、GLM-4.5-Air、Nemotron-3-Super、Qwen3.5-122B和Mistral-Small-4-119B等模型,但社区注意到这些模型现在已经发布数月。当前发布的新模型要么更小(25B-35B),要么更大(200B+),这引发了关于约120B MoE家族是否已…
-
Cohere 发布 North Mini Code,用于代理软件工程
Cohere 发布了 North Mini Code,这是一款新的 300 亿参数的混合专家模型,拥有 30 亿活跃参数,专为代理软件工程任务设计。该模型是 Cohere 新模型系列中的首款,可在 Hugging Face 上根据 Apache 2.0 许可证使用。基准测试表明,North Mini Code 在与同等规模的其他开源编码模型相比时表现具有竞争力,甚至在编码基准测试中超越了一些更大的模型。
-
阿根廷 AI 代理 Pucho 通过订阅提供无限模型访问
Pucho 是一个在阿根廷开发并在 VoidLinux 上运行的 AI 代理。虽然它使用开源技术,但其开发是私有的,并且采用订阅模式而非按 token 收费。该服务提供对五个 AI 模型的无限访问,包括 DeepSeek V4 Flash 和 Nemotron 3 Super,并集成了图像和音频识别、图像和视频生成以及 AI 代理自动化功能。
-
Nvidia 发布 Nemotron 3 Ultra,以开源模型挑战 OpenAI
Nvidia 发布了其 Nemotron 3 Ultra,这是一个开源 AI 模型,据称是迄今为止能力最强的美国开发模型。此次发布标志着 Nvidia 不再仅仅是芯片供应商,而是进军 AI 模型开发领域。Nemotron 3 Super 变体拥有 100 万个 token 的上下文窗口和显著的速度,使其成为 OpenAI 等模型的竞争对手,并可能通过挑战依赖云的专有模型来重塑 AI 市场。
-
蚂蚁集团 Ling-2.6-flash 通过Token效率降低AI成本
蚂蚁集团推出的新模型 Ling-2.6-flash(匿名测试代号 Elephant Alpha)旨在通过优化Token效率,显著降低AI的运营成本。该模型采用混合线性架构以实现更快的推理速度,并声称在类似Agent的任务中,仅用少量Token即可达到与其他领先模型相当或更优的性能。早期测试表明,它完成任务所需的Token量约为 Qwen3.5 和 Nemotron-3-Super 等竞争对手的一半,同时还展现出强大的编码和规划能力。
-
研究发现:大语言模型在医疗分诊中存在显著性别偏见
一项名为 EQUITRIAGE 的新审计评估了五种大型语言模型在急诊科分诊中的性别偏见,发现所有模型均表现出超过 5% 阈值的偏见。DeepSeek-V3.1 和 Gemini-3-Flash 表现出显著的女性漏诊倾向,翻转率在 9.9% 到 43.8% 之间。虽然人口统计信息匿名化降低了 Gemini 的偏见,但 DeepSeek 仍显示出残留偏见,表明年龄是促成因素之一。该研究强调,不同模型具有不同的潜在偏见机制,并强调在临床部署…
-
Together AI 发布 NVIDIA 的多模态和 1M 上下文 Nemotron 3 模型
Together AI 已在其平台上发布了 NVIDIA 的 Nemotron 3 模型,包括多模态的 Nano Omni 和大上下文的 Super。Nemotron 3 Nano Omni 是一个 30B 参数模型,擅长同时处理视频、图像、音频和语言的推理,非常适合代理应用。Nemotron 3 Super 是一个 120B 参数模型,拥有 100 万个 token 的上下文窗口和多 token 预测,可高效处理复杂的推理和长上下文…