TensorRT-LLM
PulseAugur coverage of TensorRT-LLM — every cluster mentioning TensorRT-LLM across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
消费级RTX 4090 GPU在LLM推理中达到100 T/s
一个社区项目展示了消费级RTX 4090 GPU在运行Qwen 3.8 Flash Next大型语言模型时,可以达到每秒100万亿个token。这一壮举是通过激进的int4量化、使用更小草稿模型的推测性解码管道以及使用TensorRT-LLM优化的融合推理堆栈实现的。这一成就显著降低了运行大型LLM的成本,使其对研究人员和高级用户更加普及,并挑战了Nvidia为其数据中心专用性能宣传的高端H100 GPU。
-
专用AI推理引擎将激增,超越通用工具
人们预测,用于大型语言模型的专用、单一用途推理引擎的激增将超过通用推理引擎的发展速度。这些一次性引擎,通常是从llama.cpp等现有项目分叉而来或从头开始构建,通过针对特定模型和硬件组合进行优化,实现了卓越的性能。AI编码的进步降低了创建此类专用工具的门槛,推动了这一趋势。因此,与这些高度优化的单用途替代品相比,vLLM和llama.cpp等通用引擎由于其较慢的开发和推理速度,对许多用户来说可能变得不那么重要了。
-
LLM路由方法提高效率并降低延迟 · 已追踪2个来源
一篇新研究论文介绍了一种名为HeRo(History-Aware Routing)的动态路由框架,用于大型语言模型。该框架使用一种记忆机制来跨模型深度维护路由状态。这种方法将先前的路由分数聚合为紧凑的历史表示,在Llama 3.1-8B、Llama 2-7B和Llama 2-13B的基准测试中持续优于现有方法。与此同时,Amazon SageMaker Inference推出了前缀感知路由,这是一种将具有相似前缀的请求导向同一实例的策…
-
llama.cpp b10835 修复了 NVIDIA GPU 上的 CUDA FlashAttention 发散问题
llama.cpp 项目发布了 b10835 版本,该版本解决了其在 CUDA 后端上 f16 FlashAttention 实现中的一个关键错误。此更新解决了在使用 NVIDIA GPU 上的半精度浮点注意力机制时可能导致不稳定或错误的“发散”问题。此外,该版本通过移除冗余的元数据指针赋值来优化 NVIDIA 硬件上的执行路径,从而简化了调度过程。此修复程序对于在 NVIDIA GPU 上使用 CUDA 进行本地推理的开发者和用户尤…
-
新研究探索用于效率的先进大模型量化技术
几篇新研究论文探索了用于量化大语言模型(LLM)以提高部署效率的先进技术。REAL-Q 引入了一种动态梯度下降方法,以最小化端到端 KL 散度,在 LLaMA-3.1 和 Qwen3 上显示出显著的改进。HBQ 提出了一种具有有效数字缩放的分层方法,以最大化硬件效率和准确性,优于现有方法。Q-Strata 专注于混合精度量化,用于专家混合模型,优化专家之间的比特分配。另一篇论文研究了量化损伤的结构,表明全局比特分配通常优于局部修复,而…
-
Inco AI 发布 DFlash 2 以加快 LLM 推理速度
Inco AI 发布了 DFlash 2,这是大型语言模型(LLM)投机解码的一项进展。新版本在原始 DFlash 的并行草稿方法的基础上,通过最小的延迟增加,将每次验证的输出提高了 20% 以上。DFlash 2 旨在通过在单次传递中优化 token 预测和选择,来提高推理效率,这是 AI 代理的一个关键瓶颈。
-
SGLang 为主要的 AI 推理提供支持,尽管 vLLM 的 GitHub 星标更高 · 跟踪 1 个来源
选择用于自托管大型语言模型的推理引擎对于运营效率和成本至关重要,其中 vLLM、SGLang 和 TensorRT-LLM 是主要竞争者。尽管 vLLM 的 GitHub 星标数量更高,但 SGLang 正在为 xAI 的 Grok 和 Microsoft Azure 的 DeepSeek R1 等重要部署提供支持,这凸显了社区受欢迎程度与生产使用之间的差异。这一决定会影响 GPU 利用率、延迟、硬件灵活性和工程工作量,特别是随着涉及…
-
Megakernels:过时的研究还是性能突破?
关于AI推理中“megakernels”的讨论已经转变,许多人现在认为它们在生产环境中已经过时。虽然理论上可以减少启动开销,但优化这些融合内核的复杂性常常使其比NVIDIA的TensorRT-LLM等模块化方法更慢。NVIDIA的Rubin GPU等近期硬件进展似乎旨在进一步抑制megakernel的使用。尽管如此,Cursor发布了一个名为Mixture of Kittens的开源megakernel,声称取得了显著的性能提升。
-
Snapchat部署基于LLM的生成式检索系统用于视频推荐
Snapchat推出了SnapLGR,一个用于其短视频推荐服务的新生成式检索系统。该系统利用大型语言模型(LLMs)通过从多模态项目嵌入中创建语义标识符(SIDs)并利用对比学习对其进行增强来改进内容发现。该系统还结合了在用户互动数据上的持续预训练和监督微调,以及使用TensorRT-LLM的高效服务架构。在实际A/B测试中,SnapLGR在用户参与度指标方面显示出显著的改进,包括观看时间增加0.37%,深度会话增加0.18%。
-
LLM推理优化:Prefill-Decode Disaggregation详解
一篇最新的技术文章探讨了用于优化大型语言模型(LLM)推理的Prefill-Decode Disaggregation概念。该技术将计算密集型的提示处理(预填充)阶段与内存密集型的令牌生成(解码)阶段分开。通过为每个阶段分配不同的硬件,例如为预填充使用强大的GPU,为解码使用内存优化的GPU,可以实现75-250%的显著吞吐量提升。然而,这种方法会增加复杂性和运营开销,因此它最适用于提示长度可变、并发度高且对令牌间延迟要求较低的工作负…
-
AI 模型加速语音合成并实现实时翻译
研究人员开发了 Faster IndexTTS-2,一个显著加速 GPU 部署的自回归文本到语音模型系统。新版本将 GPT 组件的推理速度提高了 5.0 倍,端到端速度提高了 3.6 倍,同时还能实现流式合成和批量推理,而对音频质量的影响极小。另外,OpenAI 已悄然推出 GPT-Realtime-Translate,一个能够跨 70 多种语言进行实时翻译的语音到语音翻译模型,定价为每分钟 0.034 美元。
-
Ollama v0.32.4 通过 Apple MLX 支持增强本地 AI,并支持多模态视觉
Ollama 发布了 v0.32.4 版本,为本地 AI 推理带来了显著的增强,特别是对于拥有 Apple Silicon 硬件的用户。此次更新通过 Apple 的 MLX 引擎支持 Laguna 模型系列,从而在集成 GPU 上实现加速推理。此外,该版本通过量化 draft-model output heads 来优化投机解码,以提高效率和准确性,并修复了 Qwen3 MoE 模型的解码问题。此次更新还包括 llama.cpp 中 …
-
NVIDIA 敦促 AI 模型协同设计以提高 GPU 利用率
NVIDIA 发布了一篇技术博客文章,强调了 AI 模型设计中的一个关键问题:由于模型未针对 GPU 架构进行优化,导致硬件利用率低下。文章解释了“算力强度”等概念的重要性,当模型设计采用低效的矩阵形状或维度时,GPU 会花费更多时间等待数据而非计算,从而导致利用率低下。NVIDIA 建议采用协同设计方法,模型设计者从一开始就考虑 GPU 规格,如瓦片大小和低精度格式,以最大限度地提高性能并降低成本。
-
新的AI运行时操作系统在通用硬件上编排模型
一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。
-
XGrammar 库通过语法约束解码确保生成有效的 JSON 输出
XGrammar 库(具体为 2026 年 6 月 27 日发布的 0.2.3 版本)提供语法约束解码功能,以确保语言模型生成有效的结构化输出(如 JSON)。该方法通过在每个生成步骤中屏蔽模型采样分布中的无效 Token 来防止输出格式错误,从而消除了重试循环的需要。XGrammar 与 vLLM、SGLang、TensorRT-LLM 和 MLC-LLM 等流行的推理引擎集成,为结构化输出生成提供后端支持。
-
NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比
NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。
-
Together AI 详解使用 NVIDIA Blackwell 进行延迟优化
Together AI 详细介绍了其优化推理延迟的方法,重点介绍了 NVIDIA 技术与其自身平台的集成。他们的系统 Together ATLAS 利用 NVIDIA Blackwell、CUDA、TensorRT-LLM 和 Dynamo 以及自定义内核,为用户实现低于 100 毫秒的响应时间。这种优化对于实现更快的推理和长上下文代码生成至关重要。
-
NVIDIA TensorRT-LLM:吞吐量最快,但需注意部署成本
NVIDIA 的 TensorRT-LLM 框架提供了令人印象深刻的吞吐量速度,但仅凭头条性能指标选择它可能会导致隐藏成本。文章指出,虽然 TensorRT-LLM 在吞吐量方面是最快的,但它可能并非适用于所有工作负载的最佳选择,如果选择不当,可能会在部署上花费用户大量时间。
-
新的推测解码方法提高了 LLM 推理速度和效率 · 跟踪 6 个来源
研究人员推出了 DominoTree,一种新颖的推测解码方法,通过使用条件树状结构显著加速 LLM 推理。该方法在 Qwen3-4B 模型上实现了高达 6.6 倍的加速,并显示出比 DDTree 和 CaDDTree 等现有技术更高的吞吐量。同时,其他研究探索了宽松的推测解码,研究速度和能力之间的权衡,并引入了 AdaptiveSD 以在 CPU 限制下实现鲁棒的、运行时自适应的推理。DSpark 是另一个框架,它将高吞吐量的并行生成…
-
NVIDIA的软件栈在Blackwell平台上大幅降低AI推理每token成本
NVIDIA正在强调其为Blackwell平台优化的集成软件栈如何显著降低AI推理的每token成本。通过协调生产运营、应用加速和基础设施访问,NVIDIA的软件栈实现了复合性能提升,使DeepSeek V4等模型的每token成本降低高达5倍。Baseten、Cognition、Deep Infra和Together AI等公司正在利用包括TensorRT-LLM等库和NVIDIA Dynamo等框架在内的该软件栈,以提高效率和扩展…