Nemotron 3 Nano 30B A3B
PulseAugur coverage of Nemotron 3 Nano 30B A3B — every cluster mentioning Nemotron 3 Nano 30B A3B across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新基准显示Base64生成能力与AI智能之间存在强关联
一项名为Encode Bench的新基准测试揭示了语言模型生成Base64编码响应的能力与其智能得分之间存在强相关性。该基准测试在需要解决问题、精确答案保留和正确编码的任务上对模型进行测试,发现与AA智能指数的皮尔逊相关性为0.91。虽然这可能表明了一种粗略的多步可靠性衡量方法,但创建者警告说,这并不能证明因果关系,可能反映了分词器行为或推理限制等其他因素。
-
HexGrid Cloud 为开放权重模型提供定制化 LLM GPU 基准测试服务
HexGrid Cloud 提供在用户指定的 GPU 和配置上对开放权重 LLM 进行基准测试的服务。他们正在征集模型和硬件设置的建议,以测试其部署平台,重点关注适合单个 H200 GPU 内存的聊天/指令模型。测试结果将包括吞吐量、延迟和成本指标,并将与完整的配置细节一起公开分享,以确保可复现性。
-
NVIDIA 发布 Nemotron-Labs-TwoTower 以实现更快的文本生成 · 跟踪 4 个来源
NVIDIA 推出了 Nemotron-Labs-TwoTower,这是一款开放权重的扩散语言模型,旨在提高文本生成吞吐量。该模型将扩散过程分为两个独立的组件:一个冻结的自回归上下文塔和一个训练好的去噪器塔。这种架构允许并行生成 token,实现了 2.42 倍的吞吐量提升,同时保留了传统自回归模型 98.7% 的质量。
-
NVIDIA 在 Hugging Face 上发布新的 Nemotron 和 Qwen AI 模型
NVIDIA 发布了包括 Nemotron-3 Nano 30B A3B 和 Qwen 模型量化版本在内的多个新 AI 模型和检查点。这些主要在 Hugging Face 上发布的版本采用 Apache 2.0 许可,并支持文本、图像和视频等多种输入类型。一些用户已计划在代理工作流中测试和比较这些新的 NVIDIA 模型与现有的 Qwen 版本。
-
NVIDIA 开源 NeMo AutoModel,MoE 微调速度提升 3.7 倍
NVIDIA 已开源 NeMo AutoModel,该工具旨在显著加速专家混合(MoE)AI 模型的微调。通过在现有的 Hugging Face Transformers v5 代码中添加一行导入,用户可以实现高达 3.7 倍的训练吞吐量提升,并将 GPU 内存使用量减少高达 32%。这种性能提升归功于专家并行、用于融合计算和通信的 DeepEP 以及用于内核加速的 Transformer Engine 等技术。
-
NVIDIA 发布 Nemotron-TwoTower 扩散语言模型
NVIDIA 推出了 Nemotron-TwoTower-30B-A3B-Base-BF16,一个新颖的、基于扩散的语言模型。该模型通过使用扩散去噪器塔来同时处理 token 块,从而偏离了传统的逐 token 生成方式。NVIDIA 报告称,这种方法在保持与其自回归模型几乎同等质量的同时,显著提高了生成速度。
-
LLM根据自然语言提示生成领域特定语言代码
研究人员推出Text2DSL,一种从自然语言描述生成领域特定语言(DSL)代码的方法。他们开发了PolkitBench数据集,包含超过4000个自然语言到Polkit规则的配对,并通过基于AST的管道进行了验证。使用GigaChat-10B和Nemotron-3-Nano模型的实验表明,提供结构化上下文(如BNF语法和API规范)可显著提高代码生成质量,将语法有效性提高到近99%,并将CodeBLEU分数提高高达95%。这种方法无需模…
-
RePoT 通过检查点恢复增强 LLM 规划能力
研究人员推出 RePoT,一种提高大型语言模型思路程序(PoT)可靠性的方法。RePoT 解决了生成计划中单个无效步骤可能导致整个序列失效的问题。通过将计划视为一系列检查点,RePoT 可以从最后一个有效步骤恢复执行,只需最少的额外 LLM 调用,从而提高了 PuzzleZoo-775 和 PlanBench Blocksworld 等基准测试的成功率。这种方法显示出显著的收益,尤其与仅错误反馈相比,突显了检查点信息对于恢复的重要性。
-
新的 4/6 量化方法通过自适应缩放提升大语言模型精度
研究人员开发了一种名为 Four Over Six (4/6) 的新量化方法,以提高 NVFP4 等低精度数值格式在大语言模型中的精度。该技术自适应地将块缩放到更小的 FP4 值,从而减少量化误差,尤其是在接近最大值时。使用 Nemotron 3 Nano 30B-A3B 模型架构进行的实验表明,与现有的 NVFP4 方法相比,4/6 方法能使训练损失更接近 BF16,且计算开销极小。