CUDA Graphs
PulseAugur coverage of CUDA Graphs — every cluster mentioning CUDA Graphs across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
ShardFlow框架使用推测解码在Qwen2.5-7B上实现28 TPS
一位开发者构建了ShardFlow,一个分布式LLM推理框架,该框架将模型分布在多台机器上,并使用推测解码来缓解WAN延迟。在Qwen2.5-7B上的基准测试显示吞吐量显著提高,使用推测解码和CUDA Graphs达到了28.10 TPS,而基线为4.92 TPS。该框架还采用了零拷贝Rust TCP中继和元设备模型切片等技术来优化性能。
-
新的WAM-Diff2框架提升了自动驾驶VLA模型的效率
研究人员开发了WAM-Diff2,一个旨在提高自动驾驶视觉-语言-动作(VLA)模型效率的新框架。该框架采用分层蒸馏策略,将预训练的自回归模型转换为更高效的扩散模型。该过程包括渐进式块自适应、块蒸馏和模型级跨尺度蒸馏,这有助于在显著加快推理速度的同时保持原始模型的语义理解。评估表明,WAM-Diff2在性能上与自回归模型相当,并提供了显著的解码速度提升,系统级优化进一步增强了这一点。
-
HARD-KV 框架将 LLM 推理速度提升 2 倍
研究人员开发了 HARD-KV,一个旨在优化长上下文大型语言模型 (LLM) 推理的新框架。该系统解决了头自适应压缩算法(通过动态内存预算提供准确性)与需要静态内存模式以提高效率的现代推理引擎(如 vLLM)之间的冲突。HARD-KV 引入了级联缓存 (Cascade Cache) 层级结构和逻辑校准 (Logits Calibration) 机制,以统一重要性指标并为不同模型头实现一致的预算分配。实验表明,HARD-KV 在保持超过…
-
研究发现AI推理延迟受内存带宽以外因素的限制
一篇新论文揭示,物理AI系统(如机器人和自动驾驶汽车)的推理性能并非如先前假设的那样仅受内存带宽的限制。研究表明,虽然批处理为1的解码工作负载以内存为主,但更快的内存并不总是能带来成比例的延迟收益,尤其是在NVIDIA H100等高带宽GPU上。该研究确定了启动端开销和不同GPU架构上量化效率的变化是影响实际部署效率的关键因素。