PulseAugur
中
实时 12:41:17
实体 FlashInfer

FlashInfer

PulseAugur coverage of FlashInfer — every cluster mentioning FlashInfer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 16
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 16 条
  1. TOOL · CL_284406 ·

    Cleave编译器优化大型模型的张量程序

    研究人员开发了Cleave,这是一种新的机器学习编译器,旨在优化大型模型的张量程序。Cleave采用符号解耦策略,首先在具有符号形状的图上执行超优化,然后在具体形状上调度转换后的图。这种方法可以有效地处理具有多个归约的计算,并已显示出显著的速度提升,生成的内核比现有基线快2.8倍。

  2. TOOL · CL_277381 ·

    Prime Intellect 推出 Prime Inference 开源模型推理平台

    Prime Intellect 推出了 Prime Inference,一个专为前沿开源 AI 模型设计的新型推理平台。该平台利用 NVIDIA Blackwell GPU,提供用于应对可变需求的无服务器端点和用于持续工作负载的预留容量。Prime Inference 旨在通过结合 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术来优化性能,并支持与 OpenAI 兼容的 API。

  3. TOOL · CL_260017 ·

    vLLM 发布 0.30.0rc1 版本,修复 FlashInfer 自动调优问题

    vLLM 发布了 0.30.0rc1 版本,其中包括一项针对分离 FlashInfer BF16 自动调优的错误修复。此版本由 jiahanc 和 OpenAI Codex 共同编写。

  4. TOOL · CL_219563 ·

    NVIDIA DGX Spark GB10:vLLM 安装和性能指南

    一份技术指南详细介绍了如何在 NVIDIA 的 DGX Spark (GB10) 硬件上安装和运行 vLLM,而无需依赖容器化环境。该指南强调了特定的 Python 版本要求以及潜在的安装陷阱,例如需要激活的虚拟环境以及 FlashInfer 的初始 JIT 构建过程。它还提供了运行 unsloth/Qwen3.6-27B-NVFP4 模型时的性能基准和配置细节,包括内存使用情况和上下文长度能力。

  5. COMMENTARY · CL_207842 ·

    理解 GPU 内核:高效 AI 推理的关键

    文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。

  6. RESEARCH · CL_215745 ·

    新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源

    三篇新研究论文介绍了用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶级排名。

  7. SIGNIFICANT · CL_195507 ·

    Kimi K3大模型自托管成本为89.52美元/小时,提供100万上下文

    Moonshot AI开发的大语言模型Kimi K3,在其自身运行环境中提供了性能报告。该模型运行在八个NVIDIA B300 SXM6 GPU上,总计拥有2.2 TB的VRAM,其上下文窗口超过100万个token。虽然为单个用户提供了近乎即时的响应时间和快速的长上下文预填充速度,但自托管这一前沿模型的成本相当可观,估计每小时为89.52美元,这使得其每个token的成本远高于高级API提供商。

  8. TOOL · CL_181100 ·

    新的WAM-Diff2框架提升了自动驾驶VLA模型的效率

    研究人员开发了WAM-Diff2,一个旨在提高自动驾驶视觉-语言-动作(VLA)模型效率的新框架。该框架采用分层蒸馏策略,将预训练的自回归模型转换为更高效的扩散模型。该过程包括渐进式块自适应、块蒸馏和模型级跨尺度蒸馏,这有助于在显著加快推理速度的同时保持原始模型的语义理解。评估表明,WAM-Diff2在性能上与自回归模型相当,并提供了显著的解码速度提升,系统级优化进一步增强了这一点。

  9. RESEARCH · CL_183287 ·

    新研究探索大语言模型效率和推理能力的提升

    多篇研究论文探讨了提高大语言模型(LLMs)效率和可靠性的方法。Hugging Face 的 LFM2.5-DSpark 通过使用推测性解码技术,展示了高达 3.2 倍的推理速度提升。OpWeave 和 LayerRoute 分别提出了用于跨异构硬件优化大语言模型服务和实现自适应层跳过的框架。其他研究则关注大语言模型的推理和校准,其中 ZebraArena 为工具增强型大语言模型提供了诊断环境,而 Efficiency Halluci…

  10. RESEARCH · CL_147894 ·

    LLM 推动 GPU 内核生成和推理优化 · 跟踪 4 个来源

    研究人员正在开发利用大型语言模型 (LLM) 优化 GPU 内核生成的先进方法。其中一种方法在 MLSys 2026 上提出,使用以工程化为中心(harness-centered)的系统来约束、验证和分析 LLM 生成的代码,与基线实现相比实现了显著的加速。另一项研究引入了 Atrex-Bench,这是一个源自生产推理跟踪的基准测试,用于评估 LLM 生成的 GPU 内核,结果显示当前模型仅能达到硬件潜力的约 10%,并且经常依赖回退…

  11. TOOL · CL_132145 ·

    DeepSeek V4 Flash with DSpark 相比 EAGLE 显示出显著的速度提升

    一位 Reddit 用户分享了他们使用 SGLang 通过 DSpark 部署 DeepSeek V4 Flash 模型在 HGX-H200 系统上的经验。他们将 DSpark 的性能与 EAGLE 进行了比较,发现 DSpark 的速度明显更快,尤其是在更高的批次大小下。基准测试表明,DSpark 能够在每个步骤中生成更多的 token,从而在接受率略有下降的情况下实现显著的吞吐量提升。

  12. RESEARCH · CL_111257 ·

    PersistentKV通过新的调度技术优化商品GPU上的LLM服务

    一篇新论文介绍PersistentKV,一个旨在优化长上下文大语言模型(LLM)在商品GPU上服务的系统。PersistentKV采用页感知解码调度和原生块表注意力引擎来减少KV缓存碎片并提高吞吐量。与FlashInfer等现有方法相比,该系统在某些工作负载上展示了高达1.4倍的性能提升,并将工作分配确定为LLM服务效率的关键因素。

  13. TOOL · CL_97426 ·

    MiniMax M3 集成 NVIDIA 硬件、vLLM 和 Inferact

    SemiAnalysis 报道了 MiniMax AI 的 M3 模型与 NVIDIA 硬件成功集成,特别强调了 vLLM 项目和 Inferact 的 EAGLE3 规格解码。此次合作专注于实现分离式推理,并优化 MoE 内核以提高性能。MiniMax M3 模型与 DeepSeek V4 和 Kimi-K2.6 等其他先进的开放式智能体模型并列,NVIDIA Blackwell 硬件在性能上优于 NVIDIA Hopper。

  14. TOOL · CL_68380 ·

    新框架加速 NVIDIA H20 GPU 上的 LLM 推理

    研究人员开发了 FlashMLA-ETAP,一个旨在显著加速 NVIDIA H20 GPU 上大型语言模型推理的新框架。该框架引入了高效转置注意力流水线 (ETAP),重新配置注意力计算以减少冗余操作。与现有方法(如 FlashMLA)相比,在 64K 的序列长度下,这种方法实现了 2.78 倍的加速,同时还表现出卓越的数值稳定性。

  15. TOOL · CL_53742 ·

    新的 Qrita 算法提高了 LLM 采样效率

    研究人员开发了 Qrita,这是一种旨在提高大型语言模型中 Top-k 和 Top-p 采样效率的新型算法。通过采用基于高斯的 sigma 截断和四元枢轴搜索,Qrita 在确保确定性输出的同时,显著减小了搜索空间和内存使用量。这种新方法已被集成到 vLLM 中作为默认采样器,与现有的高性能 LLM 执行引擎相比,服务吞吐量提高了 1.4 倍。

  16. TOOL · CL_48045 ·

    Fireworks AI 标记 LLM 训练与服务中的数值漂移问题

    Fireworks AI 发现,在训练和部署大型语言模型(尤其是混合专家模型 MoE 架构)时,可能出现关键的数值奇偶校验错误。这些差异源于浮点运算的非结合性以及分布式训练与推理过程中求和顺序的不同,可能导致细微但显著的问题。这种漂移会因对数概率的改变而损害基于人类反馈的强化学习(RLHF)的完整性,并侵蚀客户对微调模型的信任。