PulseAugur
实时 17:49:51
实体 CUDA Graphs

CUDA Graphs

PulseAugur coverage of CUDA Graphs — every cluster mentioning CUDA Graphs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_215165 ·

    ShardFlow框架使用推测解码在Qwen2.5-7B上实现28 TPS

    一位开发者构建了ShardFlow,一个分布式LLM推理框架,该框架将模型分布在多台机器上,并使用推测解码来缓解WAN延迟。在Qwen2.5-7B上的基准测试显示吞吐量显著提高,使用推测解码和CUDA Graphs达到了28.10 TPS,而基线为4.92 TPS。该框架还采用了零拷贝Rust TCP中继和元设备模型切片等技术来优化性能。

  2. TOOL · CL_181100 ·

    新的WAM-Diff2框架提升了自动驾驶VLA模型的效率

    研究人员开发了WAM-Diff2,一个旨在提高自动驾驶视觉-语言-动作(VLA)模型效率的新框架。该框架采用分层蒸馏策略,将预训练的自回归模型转换为更高效的扩散模型。该过程包括渐进式块自适应、块蒸馏和模型级跨尺度蒸馏,这有助于在显著加快推理速度的同时保持原始模型的语义理解。评估表明,WAM-Diff2在性能上与自回归模型相当,并提供了显著的解码速度提升,系统级优化进一步增强了这一点。

  3. TOOL · CL_117583 ·

    HARD-KV 框架将 LLM 推理速度提升 2 倍

    研究人员开发了 HARD-KV,一个旨在优化长上下文大型语言模型 (LLM) 推理的新框架。该系统解决了头自适应压缩算法(通过动态内存预算提供准确性)与需要静态内存模式以提高效率的现代推理引擎(如 vLLM)之间的冲突。HARD-KV 引入了级联缓存 (Cascade Cache) 层级结构和逻辑校准 (Logits Calibration) 机制,以统一重要性指标并为不同模型头实现一致的预算分配。实验表明,HARD-KV 在保持超过…

  4. RESEARCH · CL_62734 ·

    研究发现AI推理延迟受内存带宽以外因素的限制

    一篇新论文揭示,物理AI系统(如机器人和自动驾驶汽车)的推理性能并非如先前假设的那样仅受内存带宽的限制。研究表明,虽然批处理为1的解码工作负载以内存为主,但更快的内存并不总是能带来成比例的延迟收益,尤其是在NVIDIA H100等高带宽GPU上。该研究确定了启动端开销和不同GPU架构上量化效率的变化是影响实际部署效率的关键因素。