NVIDIA Dynamo
PulseAugur coverage of NVIDIA Dynamo — every cluster mentioning NVIDIA Dynamo across labs, papers, and developer communities, ranked by signal.
- 2026-07-07 product_launch NVIDIA launched Dynamo, a new open-source framework for LLM and agent inference. 来源
8 天有情绪数据
-
LLM 服务拆分为两个阶段,GPU 通量加倍
现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…
-
Prime Intellect 推出 Prime Inference 开源模型推理平台
Prime Intellect 推出了 Prime Inference,一个专为前沿开源 AI 模型设计的新型推理平台。该平台利用 NVIDIA Blackwell GPU,提供用于应对可变需求的无服务器端点和用于持续工作负载的预留容量。Prime Inference 旨在通过结合 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术来优化性能,并支持与 OpenAI 兼容的 API。
-
Kubernetes LLM 服务:拥挤的领域与关键的差距已识别
在 Kubernetes 上部署大型语言模型的服务领域正在迅速发展,许多曾经开放的挑战现在已被资金雄厚的项目和标准所解决。KV 缓存感知路由、预填充/解码分离、分数 GPU 共享和基本 GPU 调度原语等领域正变得拥挤。然而,仍然存在显著的差距,特别是在将模型权重分发视为一等 Kubernetes 原语方面,这目前会导致漫长的冷启动时间。
-
NVIDIA 的 Shadow Engine Recovery 将 LLM 停机时间缩短至几秒钟
NVIDIA 推出了 Shadow Engine Recovery 功能,旨在大幅缩短大型语言模型 (LLM) 推理的停机时间。这项新功能允许备用引擎接管,耗时约 7.3 秒,相比冷重启通常需要的 283 秒有了显著改进。通过在相同的 GPU 上维护一个就绪引擎,并利用 NVIDIA Dynamo 的 GPU Memory Service 共享权重,该功能旨在几乎消除服务中断。
-
EAServe 采用新的编码感知架构优化多模态大语言模型服务
研究人员开发了 EAServe,一个旨在优化多模态大语言模型 (MLLM) 服务的新系统。与现有框架在 MLLM 的三阶段编码-预填充-解码 (EPD) 管道中遇到的困难不同,EAServe 将编码阶段重新定位为管道的控制点。这种方法允许自适应微批处理、动态 GPU 分区以及对共驻预填充工作程序的速率控制卸载。评估表明,EAServe 在吞吐量和 GPU 利用率方面显著优于 NVIDIA Dynamo 和 vLLM。
-
Pinterest 发布由 AI 驱动的房间重新设计工具“Restyle”
Pinterest 正在推出一项名为 Restyle 的新 AI 功能,目前在美国和加拿大的用户中进行 Beta 测试。该工具允许用户上传房间照片,尝试不同的家具、装饰和油漆颜色,甚至可以可视化不同风格的空间。该功能旨在弥合灵感与购买之间的差距,使用户能够看到商品在自己家中的样子,从而可能从保存的图钉中带来更多销售。
-
NVIDIA Vera Rubin NVL72 系统在 MLPerf Inference v6.1 性能测试中首次亮相并取得领先
NVIDIA 宣布其新的 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中取得了领先性能。该系统在 Qwen3-VL 和 DeepSeek-R1 等要求严苛的模型上,吞吐量比前代 GB300 NVL72 高出 3.7 倍。这一性能归功于跨硬件和软件的全栈协同设计,包括增强的 Tensor Cores、Transformer Engine 和优化的互连。NVIDIA 还强调了该系统高效的扩…
-
NVIDIA 通过新平台和合作伙伴关系提高 AI 工厂效率
在 AI Infra Summit 上,NVIDIA 宣布了其 AI 基础设施平台的进展,重点关注能效和代币优化。关键进展包括与亚马逊的 Annapurna Labs 在高带宽内存方面以及与 d-Matrix 在 NVLink Fusion 方面的合作。此外,Emerald AI 与 Silicon Valley Power 合作展示了一个 AI 工厂灵活负载计划,Lambda 报告称使用 NVIDIA DSX MaxLPS 可将每瓦…
-
NVIDIA 通过 CUDA Rust 项目支持 Rust 编写 GPU 内核
NVIDIA 正在通过推出 CUDA Rust 来扩展其 GPU 编程生态系统,使开发人员能够直接使用 Rust 编写 GPU 内核。该计划利用 NVlabs 的两个新开源项目:用于单指令多线程 (SIMT) 模型的 cuda-oxide 和用于较新 Tile 模型的 cutile-rs。这两个项目都旨在通过利用 Rust 的编译时检查来防止常见的内存别名错误,从而提高安全性,这是系统级 AI 开发的重要一步。
-
Meryem Arik 解释了如何通过系统性优化降低 AI 推理成本
Meryem Arik 发表了关于降低 AI 推理成本的演讲,强调了在各种工作负载中进行系统性优化的重要性。讨论涵盖了数据转换、离线代理和聚合洞察的策略,并提供了实际示例。探讨的关键领域包括在 NVIDIA 和 AMD GPU 上测量和优化成本,以及理解 vLLM、SGLang 和 Dynamo 等技术的权衡。
-
Together 的 ThunderAgent 优化 AI 推理,提高吞吐量并降低延迟 · 跟踪 9 个来源
Together 开发了 ThunderAgent,这是一个开源推理优化工具,旨在解决代理工作流中的 KV 缓存颠簸问题。当代理任务在 GPU 密集型推理和等待外部工具之间交替时,会出现此问题,导致内存使用效率低下和性能下降。ThunderAgent 通过将代理工作流视为可调度程序来解决此问题,从而实现更智能的内存管理和路由到具有可用容量的节点。据报道,该工具提供了显著的性能改进,包括单节点吞吐量提高高达 2.5 倍,在高并发下 P5…
-
ThunderAgent 提升 AI 代理的 GPU 通量,被 ICML 2026 录用
Together 开发了 ThunderAgent,这是一种调度器级别的解决方案,旨在通过缓解 KV 缓存抖动来优化代理推理的 GPU 使用率。这项创新在单节点吞吐量方面提高了 2.5 倍,在高并发下将 P50 延迟降低了十倍。ThunderAgent 已被 ICML 2026 选为 Spotlight 论文,并已被 Skyrlos 和 NVIDIA Dynamo 等项目采用,为现有的引擎配置提供即插即用集成。
-
LLM推理优化:Prefill-Decode Disaggregation详解
一篇最新的技术文章探讨了用于优化大型语言模型(LLM)推理的Prefill-Decode Disaggregation概念。该技术将计算密集型的提示处理(预填充)阶段与内存密集型的令牌生成(解码)阶段分开。通过为每个阶段分配不同的硬件,例如为预填充使用强大的GPU,为解码使用内存优化的GPU,可以实现75-250%的显著吞吐量提升。然而,这种方法会增加复杂性和运营开销,因此它最适用于提示长度可变、并发度高且对令牌间延迟要求较低的工作负…
-
Together AI 详解使用 NVIDIA Blackwell 进行延迟优化
Together AI 详细介绍了其优化推理延迟的方法,重点介绍了 NVIDIA 技术与其自身平台的集成。他们的系统 Together ATLAS 利用 NVIDIA Blackwell、CUDA、TensorRT-LLM 和 Dynamo 以及自定义内核,为用户实现低于 100 毫秒的响应时间。这种优化对于实现更快的推理和长上下文代码生成至关重要。
-
NVIDIA Dynamo 框架加速大语言模型代理推理
NVIDIA 发布了 Dynamo,一个专为大语言模型 (LLM) 和代理系统推理设计的新开源框架。该框架解决了基于代理的 AI 不断变化的需求,这些需求涉及大量的顺序和并行模型及工具调用,这与 Triton 等旧推理服务器所设计的简单请求-响应模式不同。Dynamo 的 KV 路由功能专门用于加速这些复杂的代理工作流。
-
NVIDIA的软件栈在Blackwell平台上大幅降低AI推理每token成本
NVIDIA正在强调其为Blackwell平台优化的集成软件栈如何显著降低AI推理的每token成本。通过协调生产运营、应用加速和基础设施访问,NVIDIA的软件栈实现了复合性能提升,使DeepSeek V4等模型的每token成本降低高达5倍。Baseten、Cognition、Deep Infra和Together AI等公司正在利用包括TensorRT-LLM等库和NVIDIA Dynamo等框架在内的该软件栈,以提高效率和扩展…
-
新的DynAMO引擎提升了工业自动化中LLM智能体的效率
研究人员开发了DynAMO,一个旨在提高工业自动化中LLM驱动的智能体的效率和安全性的新引擎。DynAMO采用带有拓扑多智能体调度的“计划-然后执行”架构,创建可验证的工作流图,支持顺序和并行执行。在AssetOpsBench基准测试上的实验表明,DynAMO通过并行化和受控的推理重叠,可以将端到端延迟最多降低1.8倍,同时在故障注入下保持鲁棒性。
-
新研究增强了用于机器人和视觉推理的VLA模型
近期研究探索了增强用于机器人操作和通用视觉推理的视觉-语言-动作(VLA)模型。研究通过域随机化和照片级真实感渲染来研究模拟到现实的泛化能力,并提出诸如 Faithful Warm-Start 等方法,通过在强化学习前确保视觉保真度来提高VLM推理的稳定性。其他工作引入了置信度驱动的测试时强化学习,无需外部奖励即可实现自我改进,以及状态感知分词器,以更好地从离散代码中解码动作。此外,研究还检查了VLA模型中的架构冗余,发现语言骨干对于…
-
MiniMax AI 发布 4280 亿参数 M3 多模态模型
MiniMax AI 发布了其 M3 系列模型,参数量为 4280 亿。该公司表示,参数量被刻意限制,以便爱好者能够以较低成本在本地执行。M3 系列是能够跨文本、图像和视频进行推理的多模态模型。
-
新分析揭示了 GPU 饱和如何影响分解式 AI 推理
研究人员开发了一种用于分解式推理架构的博弈论分析,该架构将预填充和解码阶段分离到不同的 GPU 池中。该研究以 NVIDIA Dynamo 为案例研究,将该系统建模为三个耦合博弈,并识别出 GPU 饱和如何导致性能下降。基于此分析,设计了一个自适应控制器来优化路由和降低延迟,在降低无政府状态代价方面显示出显著的改进。