PulseAugur
实时 21:35:05
实体 CUDA

CUDA

PulseAugur coverage of CUDA — every cluster mentioning CUDA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
102
90 天内 304
发布 · 30天
0
90 天内 0
论文 · 30天
16
90 天内 67
层级分布 · 90 天
主题
关系
情绪 · 30 天

28 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_216204 ·

    新的Im2win卷积方法提高了GPU性能和内存效率

    研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。

  2. TOOL · CL_215630 ·

    SemiAnalysis 发布 AgentX 数据集以用于代理推理

    SemiAnalysis 发布了 AgentX,这是一个开源数据集,专为代理推理设计,具有 100 万个 token 的上下文长度和多轮对话能力。该数据集旨在测试 CUDA 在代理推理场景中的主导地位的韧性。它还强调了 GB300 NVL72、MI355 和 Nvidia B200 等硬件配置,表明这些对于此类高级推理任务是相关的。

  3. COMMENTARY · CL_215265 ·

    自托管 LLM:盈亏平衡取决于工作负载比例,而非仅仅是数量

    自托管大型语言模型 (LLM) 本身并不比使用 API 更便宜,其盈亏平衡点取决于特定的工作负载比例,而不是固定的 token 数量。消费级 GPU 上的生产实例每月成本约为 850 美元,其中人工成本是最大的组成部分。自托管的决定应考虑成本扩展、数据隐私和网络延迟等因素,而采用混合方法,将本地模型用于大批量或受监管流量,API 用于复杂推理,通常是最有效的策略。

  4. TOOL · CL_214474 ·

    开发者通过 4 位量化和带掩码的推测性解码优化 Qwen3.8-27B 的服务

    一位开发者详细介绍了一种使用 4 位量化技术结合带掩码的推测性解码头来高效服务 Qwen3.8-27B 语言模型的方法。该方法使用 Rust 和 CUDA 实现,通过降低推测性解码过程中语言模型头的计算成本来优化推理速度。开发者还提供了关于在此过程中学到的规则的见解,例如模型特定排名和为聊天模型使用聊天模板的重要性,并提供了工具供他人复制设置或使用托管端点。

  5. COMMENTARY · CL_214415 ·

    LLaMA 用户讨论英特尔/AMD GPU 用于推理而非英伟达

    r/LocalLLaMA subreddit 上的一位用户正在寻求关于使用非英伟达 GPU 进行本地大型语言模型推理的建议。他们目前拥有 RTX Pro 6000 和 RTX 5090 显卡,并考虑通过增加 GPU 来扩展他们的服务器,特别关注英特尔和 AMD 选项,因为它们每美元的显存更高。用户正在询问在这些替代硬件平台上与成熟的英伟达/CUDA 生态系统相比,推理性能的经验和比较。

  6. TOOL · CL_213316 ·

    GPU指令路径详解:从SASS到RTX 4090上的L1缓存

    本次技术深度解析探讨了GPU指令的复杂旅程,特别是全局加载(LDG.E)指令,从在NVIDIA RTX 4090上的执行到从内存中检索。分析详细说明了指令如何穿过加载/存储单元和合并器等硬件组件,最终到达L1缓存。文章强调了这一过程的复杂性和未公开性,突出了理解GPU性能需要进行实证计时实验。

  7. RESEARCH · CL_215747 ·

    GPU并行化加速大规模旅行商问题求解器

    研究人员开发了一种针对广义划分交叉(GPX)算子的细粒度GPU并行化技术,专门用于解决大规模旅行商问题(TSP)。该方法将GPX划分重构为图并行问题,采用合并内存布局和连通分量分析等技术。该方法使用CUDA实现,并行化了诸如路径合并、顶点分割和分量识别等关键步骤。实验表明,对于多达200万个城市的TSP实例,速度提升了48倍至625倍,展示了遗传算法求解器在现代多核架构上的可扩展性得到了提高。

  8. TOOL · CL_212127 ·

    TorchDCM 包提供更快的 PyTorch 离散选择建模

    研究人员开发了 TorchDCM,一个新推出的开源 Python 包,旨在利用 PyTorch 简化离散选择建模 (DCM)。该包旨在弥合传统计量经济学工作流程与可扩展、可微分计算之间的差距,特别是对于大型和计算密集型模型。TorchDCM 提供了全面的计量经济学功能,支持各种似然函数和模型规范,并显示出比现有软件显著的速度提升,尤其是在使用 CUDA 设备时。

  9. TOOL · CL_210659 ·

    本地 LLM 服务器模拟 OpenAI API,按 VRAM 自动选择模型

    一位开发者创建了一个本地 LLM 服务器,提供兼容 OpenAI 的 API,允许用户在自己的硬件上运行各种 GGUF 模型。该系统使用 llama.cpp 进行推理,FastAPI 作为服务器,并配备了一个 VRAM 感知路由器,可根据可用 GPU 内存自动选择最合适的模型。此设置旨在提供一种经济高效且注重隐私的云端 LLM 服务替代方案。

  10. TOOL · CL_210346 ·

    指南:在Ubuntu 24.04远程GPU上设置JupyterLab和PyTorch

    本指南详细介绍了如何在Ubuntu 24.04上设置JupyterLab和PyTorch,特别是用于远程GPU。它建议使用Miniconda进行包管理,以避免臃肿,并提供了在没有系统工具包的情况下安装PyTorch(支持CUDA 12.1)的步骤。设置包括在具有哈希密码的持久tmux会话中运行Jupyter,并强调通过SSH隧道或VSCode Remote-SSH进行安全设置,而不是直接暴露端口。

  11. TOOL · CL_210445 ·

    新的ERASE方法将推荐系统训练速度提高了9.51%

    研究人员开发了一种名为ERASE(EaRly bAckpropagation SchEdule)的新训练方法,旨在加速推荐系统的训练。ERASE重新解释了前向-前向(FF)的解耦机制,允许反向传播更早开始,与后续的前向传播重叠。该技术已被证明在大型点击率模型上可将训练吞吐量提高高达9.51%,同时将归一化熵保持在接近基线水平。

  12. TOOL · CL_208015 ·

    AI 模型 GPU 选型指南侧重于权重和 KV 缓存的显存

    本文为站点可靠性工程师提供了一种估算托管 AI 模型所需的 GPU 内存(显存)的方法。它将显存消耗分解为模型权重、并发请求的 KV 缓存以及其他开销。该指南强调了 AWQ 等量化技术如何显著减小模型权重的内存占用,从而为 KV 缓存腾出显存,进而提高服务容量。

  13. COMMENTARY · CL_207842 ·

    理解 GPU 内核:高效 AI 推理的关键

    文章在 GPU 计算 AI 模型的背景下解释了“内核”的概念,将其定义为由数千个线程并行执行的单个函数。文章强调,AI 推理中的主要挑战并非算术计算本身,而是有效地管理 GPU 内存层次结构中的数据移动,特别是有限但快速的“共享内存”。FlashAttention 和 Triton 等技术被提出作为优化数据访问并最大化在需要从较慢的主内存中获取更多数据之前完成的工作的解决方案。

  14. TOOL · CL_206863 ·

    开发者详解在双RTX 3090上设置Qwen3.8-27B

    一位开发者详细介绍了在没有NVLink的双RTX 3090配置上运行Qwen3.8-27B模型所需的广泛故障排除工作。使用vLLM和SGLang的初步尝试遇到了重大问题,包括编译错误、依赖冲突和模型加载失败,尤其是在量化检查点方面。通过将CUDA 13.0与SGLang 0.5.17匹配并应用特定的无NVLink和内存相关补丁,终于取得了突破。进一步的优化包括使用DSpark进行推测解码,这显著提高了令牌生成速度。

  15. RESEARCH · CL_206963 ·

    Chenghengwei 在新款边缘 AI 芯片中集成 NPU 和 GPGPU

    Chenghengwei 推出了其首款旗舰 SoC CH3715,该芯片集成了 NPU 和 GPGPU。这一决策偏离了当前边缘 AI 芯片优先考虑 NPU 的行业趋势。公司 CEO Chu Libin 解释说,CH3715 的设计旨在应对机器视觉、雷达和工业设备等复杂现实场景的需求,这些场景需要 AI 推理、高精度浮点计算、图像处理和低延迟控制的结合,而单一 NPU 无法完全满足。通过将这些多样化的计算能力集成到单个芯片上,Cheng…

  16. RESEARCH · CL_206769 ·

    人工智能推理需要高效的 GPU 管理,以避免显存耗尽和碎片化

    管理人工智能工作负载的 GPU 资源,特别是生成媒体和大型语言模型推理,由于其高内存和计算需求,带来了重大挑战。与传统的 Web 应用程序不同,这些任务很容易耗尽 GPU 显存,导致无法恢复的错误和作业失败。为了缓解这种情况,使用作业队列和消息代理(如 BullMQ 和 Redis)的异步架构模式对于将任务摄取与执行解耦至关重要。高效的内存管理,如 PagedAttention,以及将 KV 缓存卸载到外部存储,对于减少 GPU 空闲…

  17. TOOL · CL_206748 ·

    llama.cpp 更新优化 DGX Spark 上的 CUDA 性能

    llama.cpp 项目发布了更新 b10481,其中包括针对 DGX Spark 上的 CUDA 和密集模型的优化。该版本引入了与 MMVQ(多查询向量量化)相关的更改,并为 warp 数量和批处理大小设置了特定参数。此外,它还通过允许非专家计算来处理专家混合(MoE)模型,并为 DGX Spark 配置进行了参数重命名。

  18. TOOL · CL_206113 ·

    新流程解决视频-LLM问答中的幻觉引用问题

    研究人员开发了一个自验证流程,以解决由视觉语言模型驱动的视频问答系统中出现的幻觉引用问题。这些系统经常自信地提出时间戳声明,但这些声明并未得到所引用帧的支持,从而误导用户。提出的流程包括一个初始的检索增强语言模型,该模型起草带有时间戳引用的答案,然后独立地重新检查每个引用的帧。实验表明,直接要求视觉模型验证声明由于“谄媚”效应而无效,而一个小型自然语言推理模型被证明是一个稳定且可解释的验证器,在对抗性场景中成功识别了79%的虚假声明,…

  19. TOOL · CL_205591 ·

    开发者优先考虑隐私,选择本地Whisper STT而非云API

    一位开发者详细介绍了他们决定使用OpenAI的Whisper模型在本地运行语音转文本(STT),而不是依赖Google Speech-to-Text或Amazon Transcribe等云端API。这一选择是出于隐私考虑,因为包含敏感客户信息的会议录音会保留在自己的硬件上。该设置利用了配备12GB显存的GeForce RTX 3060 GPU,运行Whisper的量化版本,并通过顺序加载模型来管理显存限制。

  20. RESEARCH · CL_215745 ·

    新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源

    三篇新的研究论文介绍用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶尖排名。