PulseAugur
中
实时 08:18:58
实体 CUDA

CUDA

PulseAugur coverage of CUDA — every cluster mentioning CUDA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
372
90 天内 375
发布 · 30天
0
90 天内 0
论文 · 30天
79
90 天内 79
层级分布 · 90 天
主题
关系
时间线
  1. 2026-09-10 product_launch NVIDIA has made CUDA available for ARM processors on Windows. 来源
情绪 · 30 天

22 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_289259 ·

    新的BEVPIPE框架支持自动驾驶感知模型的便携式GPU部署

    研究人员开发了BEVPIPE,一个旨在解决自动驾驶系统中部署复杂鸟瞰图(BEV)感知模型挑战的新框架。这些模型通过融合摄像头和LiDAR数据进行3D物体检测,由于标准推理运行时与稀疏3D卷积等专用操作之间的不匹配,常常面临部署问题。BEVPIPE对这些模型进行分区,允许密集子图由生产运行时管理,同时使用外部扩展来处理稀疏操作。据报道,这种方法实现了显著的加速并保持了高精度,同时还能在不同的GPU后端之间实现便携性。

  2. TOOL · CL_288510 ·

    llama.cpp 优化 CUDA top-k 算法以实现显著加速

    llama.cpp 项目发布了一个更新 (b11513),显著优化了 top-k 算法的 CUDA 实现。此更新用更高效的 grid-over-rows radix select 替换了 per-row DeviceTopKKernel,适用于行数较多的情况,从而大幅缩短了处理时间。例如,在 qwen4exp 模型上,使用 34,816 个 token 时,top-k 操作速度从超过 5.7 秒提高到大约 941 毫秒。该版本还根据形…

  3. SIGNIFICANT · CL_287747 ·

    联想发布搭载NVIDIA RTX Spark N1X芯片的YOGA Pro 15 AIPC

    联想发布了新款AIPC笔记本YOGA Pro 15 RTX Spark,该笔记本搭载了NVIDIA的RTX Spark N1X超级芯片。该设备旨在通过提供强大的本地AI计算能力,提升AI创作者、开发者和研究人员的个人生产力。它集成了NVIDIA的AI和RTX图形技术,能够支持本地运行大型语言模型和复杂的AI任务,无需依赖互联网,从而确保隐私和节省成本。

  4. TOOL · CL_288079 ·

    llama.cpp项目发布预发布更新,包含各种修复和优化

    llama.cpp项目已发布多个预发布更新,包括b11514,该更新解决了Musa FWHT修复和针对各种操作系统的平台证明问题。其他版本如b11512和b11511分别侧重于模型修复和CUDA优化。值得注意的是,b11509包含对CUDA CCCL版本保护的修复,而b11505解决了Vulkan TOP_K在处理无限和NaN输入时的问题。这些更新还包括了来自不同开发者的贡献以及与cpp-httplib等库的集成。

  5. TOOL · CL_286425 ·

    llama.cpp 更新 b11479 提升 CUDA pool2d 性能

    llama.cpp 项目发布了更新 b11479,其中包括改进 pool2d 函数中的 CUDA 内存读取。此次更新还为 pool2d 带来了性能增强和 __restrict__ 关键字,并调整了 POOL2D_WARP_KERNEL_MIN_WINDOW 宏。此外,该版本还修复了编译器错误。

  6. TOOL · CL_284762 ·

    新的 MPZCH 索引方法消除了大规模推荐系统中的嵌入冲突

    研究人员开发了一种名为多探针零碰撞哈希 (MPZCH) 的新索引机制,以解决大规模推荐系统中的嵌入冲突问题。MPZCH 作为开源 TorchRec 库的一部分发布,使用线性探测和带有 CUDA 内核的辅助张量来最小化或消除这些冲突。这种方法通过防止过时的嵌入继承并确保新特征有效学习,同时保持高效的训练和推理性能,从而提高了模型的“新鲜度”。

  7. TOOL · CL_284674 ·

    CNet框架通过Wirtinger导数实现复杂值深度学习

    研究人员开发了CNet,一个用于训练深度复杂值神经网络(CVNN)和使用Wirtinger导数优化复杂值函数的C++/CUDA框架。该框架采用物理原生方法,将神经网络视为复杂运算的级联,并将分类视为玻恩规则测量。CNet包含其层的CPU参考和CUDA内核,计算图跨批次克隆以进行GPU执行。该框架还集成了可学习的复杂卷积网络的信号处理原语和一个具有低内存推理模式的真实Adam优化器。初步研究表明,使用CNet构建的复杂值、FNet风格的…

  8. TOOL · CL_283706 ·

    通过提示工程和后处理,Whisper 听写准确性得到提升

    作者详细介绍了他们如何提高 Whisper 语音转文本模型在个人听写中的准确性。他们发现许多看似的错误并非听错,而是填充词、口头更正或数字格式化的问题,这些可以通过简单的后处理步骤来解决。此外,使用句子形式的初始提示,而不是术语列表,显著提高了对 Kubernetes 和 PostgreSQL 等特定技术术语的识别能力。

  9. RESEARCH · CL_283504 ·

    llama.cpp 添加 K2 Horizon dense 和 MoVA 模型支持

    llama.cpp 项目发布了更新 b11454,引入了对 K2 Horizon dense 模型及其 MoVA 变体的支持。此次更新包括模型加载、超参数和张量处理的重大更改,以及计算图的调整。此外,该版本还解决了 Unicode 处理问题,特别是零宽度非连接符和连接符字符,这些字符之前导致 Windows 加载失败。更新还整合了对 YaRN betas 的支持,并强制执行推理和工具调用的响应模式。

  10. TOOL · CL_283438 ·

    为AI工程师解析Nvidia GPU术语

    本文为AI工程师定义了必不可少的GPU术语,涵盖了从CUDA核心到NVLink的概念。文章解释了这些NVIDIA GPU概念如何影响模型拟合、执行速度和可扩展性。该文旨在使AI专业人士掌握相关知识,以了解和优化其机器学习工作负载的GPU性能。

  11. TOOL · CL_281357 ·

    llama.cpp b11422 通过新的 MUSA indexer kernel 优化 CUDA/ROCm

    llama.cpp 项目发布了 b11422 版本,其中包括对 CUDA 和 ROCm 架构的优化。具体来说,此次更新为 MUSA 引入了一个新的 vector lightning indexer kernel,解决了某些 MUSA 架构上的共享内存限制。通过分批处理,这一更改确保了具有 28 KB 静态共享内存上限的 MUSA 架构 21 和 22 可以有效地处理 indexer 查询。

  12. TOOL · CL_279805 ·

    llama.cpp 项目发布预发布更新,包含性能优化

    llama.cpp 项目发布了多个预发布更新,包括对 MoE expert 的 GPU 缓存管理改进、针对 Apple Silicon 的各种量化类型的优化,以及对 Metal fusion 操作的修复。这些更新还解决了 temperature-zero chains 的采样逻辑,并引入了新的词汇 token。这些发布涵盖了 macOS、iOS、Linux、Android 和 Windows 等广泛平台,并针对 Apple Silic…

  13. RESEARCH · CL_279305 ·

    消费级RTX 4090 GPU在LLM推理中达到100 T/s

    一个社区项目展示了消费级RTX 4090 GPU在运行Qwen 3.8 Flash Next大型语言模型时,可以达到每秒100万亿个token。这一壮举是通过激进的int4量化、使用更小草稿模型的推测性解码管道以及使用TensorRT-LLM优化的融合推理堆栈实现的。这一成就显著降低了运行大型LLM的成本,使其对研究人员和高级用户更加普及,并挑战了Nvidia为其数据中心专用性能宣传的高端H100 GPU。

  14. RESEARCH · CL_278212 ·

    Meta AI 提出循环 MoE 设计;Nvidia 加速 GPU 计算 · 跟踪 2 个来源

    Meta AI 提出了一种循环专家混合(MoE)架构设计,该设计在推理任务上的性能可媲美规模大一倍的模型。另外,Nvidia 已将其开发的计算方法集成到芝浦工业大学的 CUDA 平台中,从而在低精度 AI GPU 上实现相当于 FP64 精度的更快计算。

  15. TOOL · CL_277744 ·

    用户在配置不高的家用PC上运行510GB LLM;Meta移除AI眼镜讽刺视频

    一位用户详细介绍了他们运行大型语言模型的家用配置,包括一块拥有8GB显存的RTX 5060 GPU和31 GiB内存。他们在该硬件上成功运行了510GB的DeepSeek-V4.1-Flash模型,并指出存在三个不会触发错误消息的bug。另外,Meta在公司展示其价值1299美元的VR头显后不久,因霸凌担忧而移除了其员工使用AI眼镜的讽刺视频。

  16. TOOL · CL_277573 ·

    Redis 创始人发布专注的本地 LLM 引擎 DwarfStar 4

    Redis 的创始人 Salvatore Sanfilippo 发布了 DwarfStar 4 (ds4),一个新的本地 LLM 推理引擎。与许多旨在广泛兼容模型的引擎不同,ds4 专注于少数模型,包括 DeepSeek V4、GLM 5.x 和 Qwen 3.8 Flash Next。这种专注的方法允许进行不对称量化和驻留磁盘的模型权重等优化,从而能够在高内存机器(尤其是配备 Apple Silicon 的 Mac)上高效运行。该引…

  17. TOOL · CL_276638 ·

    llama.cpp 为 Qwen 35B 等 MoE 模型添加 MMVQ 优化

    一项提交给 llama.cpp 项目的拉取请求为专家混合(MoE)模型引入了优化,特别是针对 Qwen 35B A3B 等架构。这项名为 MMVQ 的增强功能旨在通过在 CUDA 框架内融合共享专家来提高这些模型的速度。该更改由用户 am17an 提交,是优化本地大型语言模型性能的持续努力的一部分。

  18. TOOL · CL_274058 ·

    MSI Stealth A18 AI+ 游戏笔记本电脑 RTX 5090 降价 520 美元

    MSI 正在为其 Stealth A18 AI+ 游戏笔记本电脑提供大幅折扣,该笔记本电脑配备 RTX 5090 GPU、12 核 AMD Ryzen AI 9 HX 370 CPU、64GB DDR5 RAM 和 2TB SSD。这款高端配置的售价为 3,779 美元,可节省 520 美元。该笔记本电脑拥有 18 英寸 UHD+ 显示屏,刷新率为 120Hz,并支持 Wi-Fi 7 连接。

  19. COMMENTARY · CL_274052 ·

    通过高效的 MLOps 最大化 LLM 的 GPU 价值

    文章强调,要最大化 GPU 在大型语言模型 (LLM) 中的价值,很大程度上取决于高效的软件利用率,而不仅仅是硬件能力。文章着重指出了优化 MLOps 实践的重要性,以确保像 Nvidia 和 AMD 这样的昂贵硬件不会被低估使用。文章建议,像 PyTorch 和 TensorFlow 这样的框架,以及 CUDA 和 Rocm 等专业库,在实现这种效率方面发挥着至关重要的作用。

  20. RESEARCH · CL_274074 ·

    NVIDIA CUDA 集成芝浦工业大学 Ozaki Scheme II 以加速科学计算

    芝浦工业大学的“Ozaki Scheme II”已集成到 NVIDIA 的 CUDA Toolkit 13.4 中,使专注于 AI 的 GPU 能够执行高精度科学计算。这种基于软件的方法允许原本为低精度 AI 任务优化的现有 GPU 硬件用于关键的双精度 (FP64) 矩阵计算。Ozaki Scheme II 由 Katsuhisa Ozaki 教授及其同事开发,建立在早期的 Ozaki Scheme I 之上,并使用数学技术在无需新…