NVIDIA L40S
PulseAugur coverage of NVIDIA L40S — every cluster mentioning NVIDIA L40S across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Tetra LLM 量化实现每参数 2.7 比特,提升推理速度
研究人员开发了 Tetra,一种将大语言模型(LLM)量化至平均每参数 2.7 比特的新颖方法,显著降低了内存需求。该技术基于 leech-lattice 量化,通过优化码本结构并采用专门的内核来最小化 GPU 内存加载的数据,从而实现这一目标。使用 Tetra 量化的模型,如 Qwen3 变体,在 MMLU 和 GSM8K 等基准测试中表现出与更高比特量化方法相当的性能,仅有轻微下降,同时在推理速度方面显示出显著提升。
-
H公司发布单塔多模态编码器系列NeoMME
H公司推出了NeoMME,这是一个专为提高效率而设计的新型多模态编码器系列。这些模型提供2.6亿和8亿参数两种尺寸,无需独立的视觉塔和因果解码器,通过单一Transformer架构处理文本和图像数据。这种简化的方法旨在降低计算开销,同时保持强大的性能,其中2.6亿参数的NeoMME-Retriever在文档检索基准测试中取得了有竞争力的结果。
-
AI框架AIRMap生成无线电地图速度比光线追踪快100倍
研究人员开发了AIRMap,一个用于快速无线电地图估计的深度学习框架,这对于实时无线网络模拟和数字孪生至关重要。该系统利用U-Net自动编码器,仅处理地形和建筑物高度数据即可快速准确地预测路径增益。AIRMap在波士顿的大型数据集上进行训练,并在各种环境中得到验证,其性能显著优于传统模拟器,在毫秒级推理时间内实现了低于4 dB的RMSE。
-
Compiler-first duality enables portable O(1) Mamba-2 inference
研究人员开发了一种优化 Mamba-2 推理的新方法,重点关注编译器优先的状态空间对偶性。这种方法实现了具有 $O(1)$ 复杂度的便携式自回归缓存,无需自定义 CUDA 或 Triton 内核。最终的单源推理路径在 JAX 中实现,在 Google Cloud TPU 和 NVIDIA GPU 上展示了显著的加速,实现了高硬件利用率并匹配了参考困惑度分数。
-
Flash-WAM 为世界动作模型实现 23 倍的推理加速
研究人员开发了 Flash-WAM,一个显著加快推理时间的世界动作模型新框架。传统模型需要许多去噪步骤,使得实时控制变得困难。Flash-WAM 采用模态感知步长蒸馏技术,适应视频和动作流独特的噪声特性。这使得单步推理过程成为可能,在 NVIDIA L40S 硬件上将延迟从 8 秒以上降低到 350 毫秒以下,提高了 23 倍。