PulseAugur
实时 08:19:08
实体 TensorRT-LLM

TensorRT-LLM

PulseAugur coverage of TensorRT-LLM — every cluster mentioning TensorRT-LLM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 21
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 21 条
  1. RESEARCH · CL_208342 ·

    Inco AI 发布 DFlash 2 以加快 LLM 推理速度

    Inco AI 发布了 DFlash 2,这是大型语言模型(LLM)投机解码的一项进展。新版本在原始 DFlash 的并行草稿方法的基础上,通过最小的延迟增加,将每次验证的输出提高了 20% 以上。DFlash 2 旨在通过在单次传递中优化 token 预测和选择,来提高推理效率,这是 AI 代理的一个关键瓶颈。

  2. COMMENTARY · CL_204638 ·

    SGLang 为主要的 AI 推理提供支持,尽管 vLLM 的 GitHub 星标更高 · 跟踪 1 个来源

    选择用于自托管大型语言模型的推理引擎对于运营效率和成本至关重要,其中 vLLM、SGLang 和 TensorRT-LLM 是主要竞争者。尽管 vLLM 的 GitHub 星标数量更高,但 SGLang 正在为 xAI 的 Grok 和 Microsoft Azure 的 DeepSeek R1 等重要部署提供支持,这凸显了社区受欢迎程度与生产使用之间的差异。这一决定会影响 GPU 利用率、延迟、硬件灵活性和工程工作量,特别是随着涉及…

  3. COMMENTARY · CL_182756 ·

    Megakernels:过时的研究还是性能突破?

    关于AI推理中“megakernels”的讨论已经转变,许多人现在认为它们在生产环境中已经过时。虽然理论上可以减少启动开销,但优化这些融合内核的复杂性常常使其比NVIDIA的TensorRT-LLM等模块化方法更慢。NVIDIA的Rubin GPU等近期硬件进展似乎旨在进一步抑制megakernel的使用。尽管如此,Cursor发布了一个名为Mixture of Kittens的开源megakernel,声称取得了显著的性能提升。

  4. TOOL · CL_178588 ·

    Snapchat部署基于LLM的生成式检索系统用于视频推荐

    Snapchat推出了SnapLGR,一个用于其短视频推荐服务的新生成式检索系统。该系统利用大型语言模型(LLMs)通过从多模态项目嵌入中创建语义标识符(SIDs)并利用对比学习对其进行增强来改进内容发现。该系统还结合了在用户互动数据上的持续预训练和监督微调,以及使用TensorRT-LLM的高效服务架构。在实际A/B测试中,SnapLGR在用户参与度指标方面显示出显著的改进,包括观看时间增加0.37%,深度会话增加0.18%。

  5. TOOL · CL_164638 ·

    LLM推理优化:Prefill-Decode Disaggregation详解

    一篇最新的技术文章探讨了用于优化大型语言模型(LLM)推理的Prefill-Decode Disaggregation概念。该技术将计算密集型的提示处理(预填充)阶段与内存密集型的令牌生成(解码)阶段分开。通过为每个阶段分配不同的硬件,例如为预填充使用强大的GPU,为解码使用内存优化的GPU,可以实现75-250%的显著吞吐量提升。然而,这种方法会增加复杂性和运营开销,因此它最适用于提示长度可变、并发度高且对令牌间延迟要求较低的工作负…

  6. RESEARCH · CL_160681 ·

    AI 模型加速语音合成并实现实时翻译

    研究人员开发了 Faster IndexTTS-2,一个显著加速 GPU 部署的自回归文本到语音模型系统。新版本将 GPT 组件的推理速度提高了 5.0 倍,端到端速度提高了 3.6 倍,同时还能实现流式合成和批量推理,而对音频质量的影响极小。另外,OpenAI 已悄然推出 GPT-Realtime-Translate,一个能够跨 70 多种语言进行实时翻译的语音到语音翻译模型,定价为每分钟 0.034 美元。

  7. TOOL · CL_159981 ·

    Ollama v0.32.4 通过 Apple MLX 支持增强本地 AI,并支持多模态视觉

    Ollama 发布了 v0.32.4 版本,为本地 AI 推理带来了显著的增强,特别是对于拥有 Apple Silicon 硬件的用户。此次更新通过 Apple 的 MLX 引擎支持 Laguna 模型系列,从而在集成 GPU 上实现加速推理。此外,该版本通过量化 draft-model output heads 来优化投机解码,以提高效率和准确性,并修复了 Qwen3 MoE 模型的解码问题。此次更新还包括 llama.cpp 中 …

  8. COMMENTARY · CL_159416 ·

    NVIDIA 敦促 AI 模型协同设计以提高 GPU 利用率

    NVIDIA 发布了一篇技术博客文章,强调了 AI 模型设计中的一个关键问题:由于模型未针对 GPU 架构进行优化,导致硬件利用率低下。文章解释了“算力强度”等概念的重要性,当模型设计采用低效的矩阵形状或维度时,GPU 会花费更多时间等待数据而非计算,从而导致利用率低下。NVIDIA 建议采用协同设计方法,模型设计者从一开始就考虑 GPU 规格,如瓦片大小和低精度格式,以最大限度地提高性能并降低成本。

  9. TOOL · CL_156959 ·

    新的AI运行时操作系统在通用硬件上编排模型

    一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。

  10. TOOL · CL_143574 ·

    XGrammar 库通过语法约束解码确保生成有效的 JSON 输出

    XGrammar 库(具体为 2026 年 6 月 27 日发布的 0.2.3 版本)提供语法约束解码功能,以确保语言模型生成有效的结构化输出(如 JSON)。该方法通过在每个生成步骤中屏蔽模型采样分布中的无效 Token 来防止输出格式错误,从而消除了重试循环的需要。XGrammar 与 vLLM、SGLang、TensorRT-LLM 和 MLC-LLM 等流行的推理引擎集成,为结构化输出生成提供后端支持。

  11. COMMENTARY · CL_142707 ·

    NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比

    NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。

  12. TOOL · CL_130775 ·

    Together AI 详解使用 NVIDIA Blackwell 进行延迟优化

    Together AI 详细介绍了其优化推理延迟的方法,重点介绍了 NVIDIA 技术与其自身平台的集成。他们的系统 Together ATLAS 利用 NVIDIA Blackwell、CUDA、TensorRT-LLM 和 Dynamo 以及自定义内核,为用户实现低于 100 毫秒的响应时间。这种优化对于实现更快的推理和长上下文代码生成至关重要。

  13. TOOL · CL_127239 ·

    NVIDIA TensorRT-LLM:吞吐量最快,但需注意部署成本

    NVIDIA 的 TensorRT-LLM 框架提供了令人印象深刻的吞吐量速度,但仅凭头条性能指标选择它可能会导致隐藏成本。文章指出,虽然 TensorRT-LLM 在吞吐量方面是最快的,但它可能并非适用于所有工作负载的最佳选择,如果选择不当,可能会在部署上花费用户大量时间。

  14. RESEARCH · CL_127431 ·

    新的推测解码方法提高了 LLM 推理速度和效率 · 跟踪 6 个来源

    研究人员推出了 DominoTree,一种新颖的推测解码方法,通过使用条件树状结构显著加速 LLM 推理。该方法在 Qwen3-4B 模型上实现了高达 6.6 倍的加速,并显示出比 DDTree 和 CaDDTree 等现有技术更高的吞吐量。同时,其他研究探索了宽松的推测解码,研究速度和能力之间的权衡,并引入了 AdaptiveSD 以在 CPU 限制下实现鲁棒的、运行时自适应的推理。DSpark 是另一个框架,它将高吞吐量的并行生成…

  15. TOOL · CL_118603 ·

    NVIDIA的软件栈在Blackwell平台上大幅降低AI推理每token成本

    NVIDIA正在强调其为Blackwell平台优化的集成软件栈如何显著降低AI推理的每token成本。通过协调生产运营、应用加速和基础设施访问,NVIDIA的软件栈实现了复合性能提升,使DeepSeek V4等模型的每token成本降低高达5倍。Baseten、Cognition、Deep Infra和Together AI等公司正在利用包括TensorRT-LLM等库和NVIDIA Dynamo等框架在内的该软件栈,以提高效率和扩展…

  16. TOOL · CL_117876 ·

    新技术通过预解码会话加速大语言模型推理

    研究人员引入了一种名为推测性预定位的新技术,以提高大型语言模型无状态推理服务器的效率。该方法将解码会话向前推进到下一个决策点,有效地将预填充和入口解码任务移出关键路径。该方法旨在通过允许下一个请求从预付费条目恢复,或者在某些置信度阈值下,通过快速词汇扫描从缓存分布中得到答案,从而减少延迟,与传统方法相比显著缩短了响应时间。

  17. COMMENTARY · CL_79311 ·

    每瓦特令牌数将决定 2026 年 GPU 和散热方案

    2026 年 AI 计算的主要瓶颈将从原始处理能力转向效率,特别是每瓦特令牌数。这是因为推理(目前占 AI 计算支出的绝大部分)本质上是一个功耗受限的问题,尤其是在数据中心功耗分配固定的情况下。因此,能够最大化每兆瓦特生成令牌数的最高效 GPU 将比那些拥有最高 FLOPS 的 GPU 更受青睐。服务软件和数值精度(如 FP8 和 FP4)的进步可以在不要求新硬件的情况下显著降低每令牌成本,提供比仅购买更多 GPU 更直接、更具成本效…

  18. TOOL · CL_78725 ·

    LLM推理手册解释Token生成和优化

    本手册深入探讨了大型语言模型(LLM)推理的工程学科,解释了模型如何生成Token以及生产系统中使用的先进优化技术。它涵盖了预填充(prefill)和解码(decode)、KV缓存(KV cache)以及关键性能指标等基本概念,然后探讨了量化(quantization)、PagedAttention和推测性解码(speculative decoding)等优化策略。该指南还详细介绍了vLLM、TensorRT-LLM和SGLang等现…

  19. TOOL · CL_68468 ·

    KForge使用LLM代理自动生成AI加速器内核

    研究人员开发了KForge,一个利用LLM驱动的代理自动生成AI加速器优化内核的框架。该系统通过采用迭代细化循环来应对为不同硬件创建高效代码的挑战。一个代理根据编译反馈生成和细化内核,而另一个代理分析性能数据以指导优化。KForge已在NVIDIA和Intel硬件上展示了优于现有解决方案的性能。

  20. TOOL · CL_40951 ·

    vLLM 生产指南详细介绍关键配置决策以提升性能

    本文提供了一份优化 vLLM 部署的指南,重点关注影响性能和成本的三个关键配置决策。文章详细介绍了静态 KV 缓存分配如何导致 GPU 内存不足错误,并强调了选择正确的服务框架、管理 KV 缓存与模型权重的内存预算以及配置分块预填充和前缀缓存等批处理策略的重要性。该指南还概述了常见的故障模式,并为有效的 vLLM 运行提供了架构见解。