TileLang
PulseAugur coverage of TileLang — every cluster mentioning TileLang across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的热带卷积方法提高了 CNN 的效率和准确性
研究人员引入了热带卷积神经网络(TCNN)的新扩展,称为复合热带卷积(cTCNN)和并行热带卷积(pTCNN)。这些新算子旨在增强 TCNN 的表示能力,TCNN 以其比标准卷积神经网络(CNN)更低的计算成本而闻名,通过用 min/maxplus 运算替换乘法运算。所提出的方法在单个层内组合不同的代数运算,以在提高准确性的同时保持效率。提供了一个开源的、与 PyTorch 兼容的、带有优化 GPU 内核的实现,实验表明在图像分类和语…
-
InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构
研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。
-
Muxi GPU拥抱开源,构建AI生态
中国GPU制造商Muxi推出了其新的Xisi S600超节点和Xisuo X300科学智能GPU。该公司强调其MXMACA软件栈,旨在通过确保与现有代码库的兼容性来最大限度地降低开发者的迁移成本。Muxi正在采取“上游优先”的开源战略,直接向vLLM和PyTorch等社区项目贡献代码,并旨在到2030年建立一个拥有500万开发者的AI时代安卓式生态系统。
-
TileLang通过Python接口简化GPU内核编写
一种名为TileLang的新编程语言旨在通过提供介于Triton等高级框架和CUTLASS等底层控制之间的中间层来简化GPU内核开发。TileLang允许开发人员编写Python代码,同时显式定义数据在内存层次结构和流水线阶段的放置。然后,编译器会推断线程映射并优化布局,从而降低了通常与手动线程管理相关的复杂性。
-
摩尔线程联合开源AI开发者社区,共建MUSA GPU生态
中国GPU制造商摩尔线程召集了一场关于将其MUSA架构与SGLang等关键开源大模型推理框架集成的交流会。此次活动汇集了SGLang、TileLang和Mooncake等项目的核心开发者,标志着国内GPU行业正从硬件规格转向生态系统开发。摩尔线程旨在使其GPU无缝融入大模型部署的主流开源工程流程,强调与开发者的兼容性和易集成性。
-
DeepSeek V4 通过自定义内核取代 cuBLAS 实现更快的性能
DeepSeek 开发了一个自定义内核栈 DeepGEMM 和 TileLang,其性能不仅媲美,而且超越了 NVIDIA 的 cuBLAS。此自定义实现实现了比特级确定性和批次不变性,解决了其他工作负载平衡策略(如 splitK 或 split-KV)中常见的非确定性输出问题。这项创新在于其浮点数学方法,确保了调试和训练结果的一致性。
-
阿里巴巴的 Qwen 发布 FlashQLA,用于高性能线性注意力核函数
阿里巴巴的 Qwen 团队发布了 FlashQLA,这是一套使用 TileLang 开发的新型高性能线性注意力核函数。这些核函数旨在提高大型语言模型中注意力机制的效率。该团队还分享了其 Qwen 模型的基准测试结果,展示了不同配置下的性能。