PulseAugur
实时 05:44:30
实体 FlashInfer

FlashInfer

PulseAugur coverage of FlashInfer — every cluster mentioning FlashInfer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. COMMENTARY · CL_207842 ·

    理解 GPU 内核:高效 AI 推理的关键

    文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。

  2. TOOL · CL_215745 ·

    KernelArc 多智能体框架在 GPU 内核优化基准测试中名列前茅

    研究人员推出 KernelArc,一个专为跨不同工作负载优化 GPU 内核而设计的新型多智能体框架。该框架利用专业智能体通过共享内存和基准测试守护进程进行协作,以提高性能。在 NVIDIA H100 和 B200 GPU 上使用 SOL-ExecBench 进行的评估表明,KernelArc 的性能优越,在所有评估的任务中均获得第一名。

  3. SIGNIFICANT · CL_195507 ·

    Kimi K3大模型自托管成本为89.52美元/小时,提供100万上下文

    Moonshot AI开发的大语言模型Kimi K3,在其自身运行环境中提供了性能报告。该模型运行在八个NVIDIA B300 SXM6 GPU上,总计拥有2.2 TB的VRAM,其上下文窗口超过100万个token。虽然为单个用户提供了近乎即时的响应时间和快速的长上下文预填充速度,但自托管这一前沿模型的成本相当可观,估计每小时为89.52美元,这使得其每个token的成本远高于高级API提供商。

  4. TOOL · CL_181100 ·

    新的WAM-Diff2框架提升了自动驾驶VLA模型的效率

    研究人员开发了WAM-Diff2,一个旨在提高自动驾驶视觉-语言-动作(VLA)模型效率的新框架。该框架采用分层蒸馏策略,将预训练的自回归模型转换为更高效的扩散模型。该过程包括渐进式块自适应、块蒸馏和模型级跨尺度蒸馏,这有助于在显著加快推理速度的同时保持原始模型的语义理解。评估表明,WAM-Diff2在性能上与自回归模型相当,并提供了显著的解码速度提升,系统级优化进一步增强了这一点。

  5. RESEARCH · CL_183287 ·

    新的大语言模型研究致力于加速训练、领域适应和推理效率

    多篇在 arXiv 上发表的研究论文探索了优化大语言模型(LLM)训练和推理的新方法。A-3PO 提出了一种近似策略优化方法,以加速 LLM 训练;Diffract 通过检查权重矩阵和注意力头来分析领域适应;ZeroLock 引入了一种无反向传播算法,用于内存高效的 LLM 训练;DistillCache 使用强化学习进行推理过程中的自适应 KV 缓存驱逐。其他研究则侧重于通过采样多样性提高 LLM 推理性能,防范针对 KV 缓存的侧…

  6. RESEARCH · CL_147894 ·

    LLM 推动 GPU 内核生成和推理优化 · 跟踪 4 个来源

    研究人员正在开发利用大型语言模型 (LLM) 优化 GPU 内核生成的先进方法。其中一种方法在 MLSys 2026 上提出,使用以工程化为中心(harness-centered)的系统来约束、验证和分析 LLM 生成的代码,与基线实现相比实现了显著的加速。另一项研究引入了 Atrex-Bench,这是一个源自生产推理跟踪的基准测试,用于评估 LLM 生成的 GPU 内核,结果显示当前模型仅能达到硬件潜力的约 10%,并且经常依赖回退…

  7. TOOL · CL_132145 ·

    DeepSeek V4 Flash with DSpark 相比 EAGLE 显示出显著的速度提升

    一位 Reddit 用户分享了他们使用 SGLang 通过 DSpark 部署 DeepSeek V4 Flash 模型在 HGX-H200 系统上的经验。他们将 DSpark 的性能与 EAGLE 进行了比较,发现 DSpark 的速度明显更快,尤其是在更高的批次大小下。基准测试表明,DSpark 能够在每个步骤中生成更多的 token,从而在接受率略有下降的情况下实现显著的吞吐量提升。

  8. RESEARCH · CL_111257 ·

    PersistentKV通过新的调度技术优化商品GPU上的LLM服务

    一篇新论文介绍PersistentKV,一个旨在优化长上下文大语言模型(LLM)在商品GPU上服务的系统。PersistentKV采用页感知解码调度和原生块表注意力引擎来减少KV缓存碎片并提高吞吐量。与FlashInfer等现有方法相比,该系统在某些工作负载上展示了高达1.4倍的性能提升,并将工作分配确定为LLM服务效率的关键因素。

  9. TOOL · CL_97426 ·

    MiniMax M3 集成 NVIDIA 硬件、vLLM 和 Inferact

    SemiAnalysis 报道了 MiniMax AI 的 M3 模型与 NVIDIA 硬件成功集成,特别强调了 vLLM 项目和 Inferact 的 EAGLE3 规格解码。此次合作专注于实现分离式推理,并优化 MoE 内核以提高性能。MiniMax M3 模型与 DeepSeek V4 和 Kimi-K2.6 等其他先进的开放式智能体模型并列,NVIDIA Blackwell 硬件在性能上优于 NVIDIA Hopper。

  10. TOOL · CL_68380 ·

    新框架加速 NVIDIA H20 GPU 上的 LLM 推理

    研究人员开发了 FlashMLA-ETAP,一个旨在显著加速 NVIDIA H20 GPU 上大型语言模型推理的新框架。该框架引入了高效转置注意力流水线 (ETAP),重新配置注意力计算以减少冗余操作。与现有方法(如 FlashMLA)相比,在 64K 的序列长度下,这种方法实现了 2.78 倍的加速,同时还表现出卓越的数值稳定性。

  11. TOOL · CL_53742 ·

    新的 Qrita 算法提高了 LLM 采样效率

    研究人员开发了 Qrita,这是一种旨在提高大型语言模型中 Top-k 和 Top-p 采样效率的新型算法。通过采用基于高斯的 sigma 截断和四元枢轴搜索,Qrita 在确保确定性输出的同时,显著减小了搜索空间和内存使用量。这种新方法已被集成到 vLLM 中作为默认采样器,与现有的高性能 LLM 执行引擎相比,服务吞吐量提高了 1.4 倍。

  12. TOOL · CL_48045 ·

    Fireworks AI 标记 LLM 训练与服务中的数值漂移问题

    Fireworks AI 发现,在训练和部署大型语言模型(尤其是混合专家模型 MoE 架构)时,可能出现关键的数值奇偶校验错误。这些差异源于浮点运算的非结合性以及分布式训练与推理过程中求和顺序的不同,可能导致细微但显著的问题。这种漂移会因对数概率的改变而损害基于人类反馈的强化学习(RLHF)的完整性,并侵蚀客户对微调模型的信任。