PulseAugur
中
实时 17:56:22
实体 TileLang

TileLang

PulseAugur coverage of TileLang — every cluster mentioning TileLang across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_277756 ·

    DeepSeek-V4.1-Flash 模型在用户发现的 bug 修复后可在 8GB GPU 上运行

    一位用户详细介绍了他们如何在一台配备 8GB GPU 的普通家用电脑上运行巨大的 510 GB DeepSeek-V4.1-Flash 模型,速度约为 1.6-2.4 tokens/秒。这是通过修改模型的存储访问方式而非重写其核心推理代码来实现的,并得到了 Claude 和 Codex 等 AI 模型的协助。该帖子还重点介绍了在消费级 RTX 硬件上遇到的三个与数值精度和内存限制相关的特定 bug,并为每个 bug 提供了解决方案。

  2. TOOL · CL_271858 ·

    DeepSeek 开源支持华为 Ascend 硬件的 AI 基础设施

    DeepSeek 已发布其 TileLang、DeepGEMM 和 DeepEP 基础设施组件的开源 Ascend 兼容版本。这些工具旨在优化 AI 模型在华为 Ascend 硬件上的性能。此次发布旨在促进 AI 社区内更广泛的采用和发展。

  3. SIGNIFICANT · CL_270507 ·

    DeepSeek、华为开源工具挑战英伟达AI主导地位 · 跟踪10个来源

    DeepSeek 和华为联合发布了一套开源工具,旨在增强华为 Ascend AI 芯片的软件生态系统。该计划旨在提供 Nvidia 的 CUDA 平台的 viable 替代方案,提供 TileLang 编程语言、高性能计算库(DeepGEMM、FlashMLA)和分布式通信库(DeepEP)等组件。此次合作的重点是使开发人员能够更轻松地充分发挥 Ascend 硬件的全部性能,在中国培养一个独立可控的人工智能芯片软件环境。

  4. TOOL · CL_217590 ·

    vLLM 发布 0.28.0 版本,修复 Cython 兼容性问题

    vLLM 项目已发布 0.28.0 版本,其中包括一项修复,将 arm64 tilelang sdist 构建的 Cython 固定在 3.3 版本以下。此版本还包含了一个来自先前提交的 cherry-pick,并将 Kevin Luu 列为贡献者,OpenAI Codex 被列为共同作者。

  5. TOOL · CL_183220 ·

    新的热带卷积方法提高了 CNN 的效率和准确性

    研究人员引入了热带卷积神经网络(TCNN)的新扩展,称为复合热带卷积(cTCNN)和并行热带卷积(pTCNN)。这些新算子旨在增强 TCNN 的表示能力,TCNN 以其比标准卷积神经网络(CNN)更低的计算成本而闻名,通过用 min/maxplus 运算替换乘法运算。所提出的方法在单个层内组合不同的代数运算,以在提高准确性的同时保持效率。提供了一个开源的、与 PyTorch 兼容的、带有优化 GPU 内核的实现,实验表明在图像分类和语…

  6. RESEARCH · CL_158822 ·

    InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构

    研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。

  7. RESEARCH · CL_149044 ·

    Muxi GPU拥抱开源,构建AI生态

    中国GPU制造商Muxi推出了其新的Xisi S600超节点和Xisuo X300科学智能GPU。该公司强调其MXMACA软件栈,旨在通过确保与现有代码库的兼容性来最大限度地降低开发者的迁移成本。Muxi正在采取“上游优先”的开源战略,直接向vLLM和PyTorch等社区项目贡献代码,并旨在到2030年建立一个拥有500万开发者的AI时代安卓式生态系统。

  8. TOOL · CL_51969 ·

    TileLang通过Python接口简化GPU内核编写

    一种名为TileLang的新编程语言旨在通过提供介于Triton等高级框架和CUTLASS等底层控制之间的中间层来简化GPU内核开发。TileLang允许开发人员编写Python代码,同时显式定义数据在内存层次结构和流水线阶段的放置。然后,编译器会推断线程映射并优化布局,从而降低了通常与手动线程管理相关的复杂性。

  9. RESEARCH · CL_31391 ·

    摩尔线程联合开源AI开发者社区,共建MUSA GPU生态

    中国GPU制造商摩尔线程召集了一场关于将其MUSA架构与SGLang等关键开源大模型推理框架集成的交流会。此次活动汇集了SGLang、TileLang和Mooncake等项目的核心开发者,标志着国内GPU行业正从硬件规格转向生态系统开发。摩尔线程旨在使其GPU无缝融入大模型部署的主流开源工程流程,强调与开发者的兼容性和易集成性。

  10. RESEARCH · CL_21392 ·

    DeepSeek V4 通过自定义内核取代 cuBLAS 实现更快的性能

    DeepSeek 开发了一个自定义内核栈 DeepGEMM 和 TileLang,其性能不仅媲美,而且超越了 NVIDIA 的 cuBLAS。此自定义实现实现了比特级确定性和批次不变性,解决了其他工作负载平衡策略(如 splitK 或 split-KV)中常见的非确定性输出问题。这项创新在于其浮点数学方法,确保了调试和训练结果的一致性。

  11. RESEARCH · CL_09035 ·

    阿里巴巴的 Qwen 发布 FlashQLA,用于高性能线性注意力核函数

    阿里巴巴的 Qwen 团队发布了 FlashQLA,这是一套使用 TileLang 开发的新型高性能线性注意力核函数。这些核函数旨在提高大型语言模型中注意力机制的效率。该团队还分享了其 Qwen 模型的基准测试结果,展示了不同配置下的性能。