PulseAugur
中
实时 22:18:28
实体 graphics processing unit

graphics processing unit

PulseAugur coverage of graphics processing unit — every cluster mentioning graphics processing unit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
878
90 天内 879
发布 · 30天
0
90 天内 0
论文 · 30天
311
90 天内 311
层级分布 · 90 天
主题
关系
情绪 · 30 天

22 天有情绪数据

本季度 GPU 如何优化 LLM 推理?

LLM 服务基础设施的最新创新正在极大地提高大型语言模型的 GPU 效率和吞吐量。

PagedAttention 和 Continuous Batching 等技术(由 vLLM 等引擎率先推出)可优化 KV 缓存管理并防止 GPU 饥饿。这些进步对于扩展推理和解决内存带宽限制至关重要,使 LLM 部署更具成本效益和效率。

最新的硬件和基础设施挑战是什么?

人工智能计算需求的激增正在造成严重的基础设施瓶颈,尤其是在电力供应和 GPU 利用率方面。

麦肯锡预测,到 2030 年,数据中心的电力需求将以每年 24% 的速度增长,而电力供应预计将滞后。在各种 GPU 大小之间有效管理 VRAM 以及使用 AEGIS 等系统优化共享 GPU 服务器,对于最大限度地提高资源利用率和最大限度地减少运营成本至关重要。

GPU 在哪些领域找到了新的应用和技术?

GPU 正在推动从复杂的机器人技术到金融预测和高级 3D 场景重建等各个领域的突破。

GPU 上的大规模并行采样支持多机器人轨迹规划,而 GPU 加速方法可改进金融时间序列预测。BC attention 等新的注意力方法还可以加速 3D 场景重建 Transformer,展示了 GPU 在传统 AI 训练之外的多功能性。

软件和量化如何提高 GPU 效率?

包括先进的量化和微调方法在内的软件创新正在显著提高 LLM 的 GPU 性能。

FP4 fusion 等技术通过优化精度交互来加速 LLM 预训练,其性能优于 bfloat16。MaskCoFT 微调通过同时调整路由器和专家来改进专家混合 (MoE) 模型的推理,减少了专家获取和生成时间,同时保持了准确性。

在 GPU 上自托管 LLM 是否变得更加容易?

虽然在技术上可以自托管 LLM,但低效的 GPU 利用率通常使其比基于云的解决方案更昂贵,无法满足实际应用的需求。

每百万个 token 的实际成本在很大程度上取决于吞吐量,而吞吐量受 GPU、模型和服务器配置的影响。Continuous batching 等技术可以提高效率,但对于大多数实际应用而言,云服务通常能提供更好的财务和技术可行性。

近期动态

为何这些故事上榜

  • 10

    This cluster highlights the practical complexities of deploying LLMs on AWS, contrasting SageMaker with vLLM against Bedrock, and underscoring the ongoing challenge of managing GPU utilization for optimal performance.

  • 10

    The innovations of PagedAttention and Continuous Batching are critical for scaling LLM inference. This cluster emphasizes how these software advancements directly address memory and compute bottlenecks, significantly improving GPU efficiency.

  • 10

    ThunderEP's design for MoE inference on consumer GPUs is a key development for accessibility, demonstrating how communication bottlenecks can be overcome to bring powerful models to more widely available hardware.

  • 10

    McKinsey's report on surging data center power demand underscores a critical, overarching challenge for GPU-intensive AI. This cluster highlights the shift in focus from chip availability to fundamental infrastructure capacity.

  • 10

    The evolution of LLM serving into distinct prefill and decode phases, optimized by techniques like PagedAttention, is a fundamental architectural shift. This cluster explains how this maximizes GPU throughput and minimizes latency.

  • 10

    This cluster offers a pragmatic take on self-hosting LLMs, revealing that inefficient GPU utilization, rather than hardware cost, is the primary expense driver. It provides a crucial reality check for local AI deployments.

graphics processing unit报道走势

趋势

Coverage of graphics processing units is accelerating, driven by intense focus on optimizing LLM inference and addressing infrastructure challenges. Clusters like PagedAttention and Continuous Batching (279517) and LLM serving phases (281860) highlight software advancements. Simultaneously, the McKinsey report on data center power demand (285209) underscores the growing infrastructure bottleneck, while ThunderEP (275363) shows hardware-software co-design for consumer GPUs.

与同行对比

While NVIDIA remains a dominant force, the narrative is shifting towards optimizing GPU utilization and addressing broader ecosystem challenges rather than direct chip competition. The discussion around self-hosting costs (282078) and AWS deployment options (282544) indicates a focus on efficient deployment strategies. Central processing units (284734) are noted for efficiency in specific tasks like stock prediction, but GPUs remain central to high-performance AI.

话题分布

This cycle shows a strong shift towards 'infra' (data center power, shared GPU scheduling), 'software' (LLM inference optimization, quantization, fine-tuning), and 'product' (ThunderEP, Imagination E-series). There's also a notable 'safety' aspect with the SparLeak attack (275275) and continued focus on 'other' applications like robotics and financial modeling.

编辑观点

We observe a pivotal moment for GPUs, where the focus has intensely shifted from raw power to intelligent utilization and infrastructure resilience. The advancements in LLM inference optimization, like PagedAttention, are critical for scaling AI. Our read is that the industry is grappling with the immense power demands of AI while simultaneously innovating to make existing GPU resources more efficient and accessible across diverse deployment scenarios.

常见问题

如何为大型语言模型 (LLM) 推理优化 GPU?
通过 PagedAttention 和 Continuous Batching 等创新技术对 GPU 进行优化,这些技术可有效管理 KV 缓存并防止 GPU 饥饿。这些技术通常在 vLLM 等引擎中实现,可显著提高吞吐量并减少内存浪费。此外,MaskCoFT 等方法可微调专家混合 (MoE) 模型以减少专家获取,进一步提高推理效率和速度。
AI 中 GPU 部署的主要基础设施挑战是什么?
最大的挑战是数据中心日益增长的电力需求,预计每年增长 24%,超过电力供应。这需要现场发电和先进的冷却。高效的 GPU 利用率也至关重要;AEGIS 等系统可优化共享 GPU 上的深度学习训练,而关于自托管的讨论则强调,低效的利用率而非硬件成本,通常是费用的驱动因素。
在 GPU 上自托管大型语言模型 (LLM) 是否具有成本效益?
对于大多数实际应用而言,在 GPU 上自托管 LLM 通常比使用基于云的解决方案更昂贵、更慢。实际成本是由低效的 GPU 利用率驱动的,而不是硬件本身。虽然 Continuous batching 等技术可以提高吞吐量,但对于许多用户来说,在本地实现足够快的速度以满足实际应用仍然是一个挑战,因此云服务是更实际的选择。
有哪些新的硬件和软件技术正在提高 GPU 效率?
硬件创新包括 Imagination 的 E 系列 GPU,它集成了用于 AI 升级和 LLM 推理的 Neural Cores,从而减少了数据移动。在软件方面,ThunderEP 通过绕过 CPU 中继跳跃来提高消费级 GPU 上的 MoE 推理性能。此外,FP4 fusion 通过优化量化来加速 LLM 预训练,AlignQuant 则根据 GPU 架构调整精度选择,以提高效率和速度。

相关

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_289401 ·

    新框架实现大规模图拓扑深度学习的扩展

    研究人员开发了Cluster-TNN,一个旨在提高大规模图拓扑深度学习可扩展性的新框架。传统的全域训练方法由于计算需求巨大,难以处理Reddit等海量数据集。Cluster-TNN通过划分图并动态采样节点簇来创建小批量,从而在这些批次中构建高阶拓扑结构,解决了这一问题。这种方法显著降低了GPU内存使用量(平均降低83.2%),同时保持了有竞争力的性能,使得在以前无法处理的数据集上训练复杂的拓扑神经网络成为可能。

  2. TOOL · CL_289356 ·

    研究发现:本地LLM代理在数据工程任务中展现出潜力

    一项新近发表在arXiv上的研究评估了本地、开源大语言模型(LLM)代理在数据工程任务中的有效性。该研究引入了一个包含十五个出行工作流任务的基准测试,并发现闭环工作空间能显著提高成功率,最高可提升52个百分点。最强的配置达到了85.3%的构件级成功率,表明本地LLM代理可以支持一部分软件密集型数据工程工作,但可靠性取决于模型能力和任务的可验证性。

  3. TOOL · CL_289259 ·

    新的BEVPIPE框架支持自动驾驶感知模型的便携式GPU部署

    研究人员开发了BEVPIPE,一个旨在解决自动驾驶系统中部署复杂鸟瞰图(BEV)感知模型挑战的新框架。这些模型通过融合摄像头和LiDAR数据进行3D物体检测,由于标准推理运行时与稀疏3D卷积等专用操作之间的不匹配,常常面临部署问题。BEVPIPE对这些模型进行分区,允许密集子图由生产运行时管理,同时使用外部扩展来处理稀疏操作。据报道,这种方法实现了显著的加速并保持了高精度,同时还能在不同的GPU后端之间实现便携性。

  4. TOOL · CL_289110 ·

    Nodus Agents 使编码 AI 可通过 MCP 访问 GPU

    Nodus Agents 平台推出了一项名为 MCP 的新功能,允许 Claude Code、Codex 和 Cursor 等编码代理访问和管理 GPU 资源。此集成旨在弥合为模型训练等任务编写代码与在 GPU 上分配、运行和监控作业的复杂过程之间的差距。用户可以将他们的代理连接到 MCP 服务器,使他们能够直接从聊天界面估算成本、启动 GPU 作业并检索结果,并内置了防止超支的保护措施。

  5. TOOL · CL_289054 ·

    TinyForge 支持在个人 GPU 上微调小型语言模型

    Rajratan Gulabmore 开发了 TinyForge,这是一个开源工具,旨在让用户能够在个人 GPU 上微调小型语言模型。该工具还包括评估和部署这些模型的功能,使高级 AI 定制更加易于访问。

  6. COMMENTARY · CL_288635 ·

    GPU债务融资风险:折旧与云服务商控制

    使用GPU作为抵押品进行债务融资存在重大风险,因为硬件会快速贬值,并且在云托管场景中可能存在利益冲突。随着新一代半导体的出现,现有硬件的价值会降低,可能使贷方面临风险。此外,AWS等云服务商可能会决定硬件的使用方式,在售后回租安排中可能优先考虑自己的基础设施而非投资者拥有的资产。

  7. TOOL · CL_288388 ·

    AI部署最佳实践:基础设施、代理和可观察性 · 跟踪6个来源

    来自Mastodon的这组帖子提供了部署和管理AI应用程序的实用建议,重点关注基础设施、代理通信、LLM路由、RAG管道、可观察性和代理的健壮性。内容强调优化GPU基础设施,确保分布式AI代理之间的有效通信,防止LLM请求路由中的瓶颈,并通过基准测试延迟和优化参数来为生产准备RAG管道。它还强调了使用OpenTelemetry等工具对AI调用进行插桩以跟踪使用情况和延迟的重要性,并避免构建AI代理中的常见陷阱以确保生产稳定性。

  8. MEME · CL_288015 ·

    AMD 对 Intel GPU 在 Stable Diffusion AI 生成中的比较

    一位 Reddit 用户正在寻求关于使用 Stable Diffusion 进行 AI 图像和视频生成的最佳图形处理单元 (GPU) 的建议。他们正在比较 AMD 和 Intel 的特定型号,询问哪一个在 SDXL 的 zimage、ltx 和 minimax 生成等任务中会更快、更适合。

  9. TOOL · CL_287294 ·

    英伟达通过扁平化结构、使命驱动和福利留住员工

    英伟达通过独特的企业文化保持较低的员工流失率,这种文化强调扁平化的组织结构、使命驱动的方法和员工赋权。作为人工智能行业的关键参与者,该公司营造了一种鼓励员工不论资历都能提出想法的环境,领导层直接考虑这些建议。尽管工作环境要求很高,但英伟达的文化,加上折扣股票购买等福利以及对有意义工作的关注,有助于其高员工保留率。

  10. TOOL · CL_287059 ·

    新的逻辑高斯过程估计器使用动力学朗之万采样

    研究人员开发了一种新的可扩展的贝叶斯估计器,用于使用逻辑高斯过程进行条件密度估计。该方法采用动力学朗之万动力学对潜在场进行采样,提供了传统拉普拉斯或变分近似的替代方案。该估计器在具有数百万个训练观测值的照相红移基准测试中表现出竞争力,在密度和校准指标上取得了优异的成绩。

  11. TOOL · CL_287043 ·

    新的注意力方法加速3D场景重建Transformer

    研究人员开发了一种名为块状聚类注意力(BC attention)的新方法,以提高用于3D场景重建的模型Visual Geometry Grounded Transformers(VGGT)的效率。该技术通过将注意力计算限制在硬件友好的块内来减少延迟,从而降低了GPU上的计算开销和内存移动。提出的BC注意力结合了哈希超平面校准和基于阈值的误差补偿,可将全局注意力层的速度提高高达2.63倍,并将整个骨干网络的速度提高高达2.35倍,同时性能损失极小。

  12. TOOL · CL_287022 ·

    新的GradSAT框架加速浮点可满足性求解

    研究人员开发了GradSAT,一个增强可满足性模理论(SMT)求解器的新框架,特别针对无量词浮点(QF_FP)理论。该方法使用多任务学习将每个SMT子句视为独立任务,采用动态梯度归一化(GradNorm)来平衡梯度幅度,防止困难子句阻碍整体收敛。该系统具有用于连续松弛的GPU加速PyTorch后端和用于精确赋值解析的位精确局部搜索引擎,旨在提高约束求解的鲁棒性和并行性。

  13. TOOL · CL_287005 ·

    PoreML框架统一了多孔介质流动的数据生成和模型训练

    研究人员推出PoreML,这是一个开源框架,旨在推进机器学习在理解多孔介质中多相流方面的应用。该框架集成了使用GPU原生Lattice Boltzmann求解器进行数据生成,并拥有一个包含3.3 TB数据的庞大数据集,涵盖了560次模拟运行和超过158,000个时间步长,涉及各种场景。PoreML还提供了一个统一的学习组件,用于评估模型性能和物理一致性,旨在促进社区开发用于CO2储存和燃料电池运行等关键应用的可预测模型。

  14. TOOL · CL_287325 ·

    AI模型将终端UI转化为交互式图形组件

    一位开发者创建了一个拥有126万参数的小型模型,能够解析htop、vim和emacs等终端用户界面(TUI)。该模型不是将它们渲染为字符网格,而是识别边框、菜单和输入字段等UI元素。然后,这些信息被转化为声明式UI流协议,从而可以显示和交互实际的UI组件。虽然该模型在真实屏幕上实现了0.51 mIoU,并通过模板锁定减少了模型计算,但生成的UI流比原始终端数据更大。

  15. TOOL · CL_286387 ·

    发布新的AI加速器监控器;同时发布了Amiga游戏

    一款名为 Siltide 的新终端监控器已发布,旨在显示GPU、NPU和其他AI加速器的利用率、内存、进程、功耗和热数据。另外,一款名为 NYBBLE & NIBBLE 的新游戏已为Commodore Amiga开发,这是原Commodore 64冒险游戏的移植版。

  16. RESEARCH · CL_287219 ·

    新指数平衡 AI 模型性能与可持续性

    一项新研究引入了可持续性感知性能指数(SAPI),用于评估细胞和细胞核实例分割模型。该研究对 19 个预训练模型和 16 个可微调模型进行了基准测试,不仅评估了分割质量,还评估了能耗和模型大小。研究结果表明,更大、计算量更大的模型并不总是带来成比例的性能提升,这表明需要超越传统指标进行更全面的评估。SAPI 框架旨在促进生物医学图像分析中更具环境责任感的模型选择。

  17. RESEARCH · CL_285209 ·

    到2030年数据中心电力需求将激增24%:麦肯锡

    麦肯锡的一份报告显示,到2030年,数据中心的电力需求预计将每年增长24%。这种由人工智能和计算需求驱动的显著增长带来了挑战,因为电力供应预计将滞后于需求。运营商越来越多地转向现场发电解决方案,如燃气发动机和电池存储,以加速电力供应,尽管这些也带来了新的基础设施瓶颈。

  18. TOOL · CL_284911 ·

    新方法利用GPU加速改进金融时间序列预测

    研究人员开发了用于预测正值金融时间序列的对数乘法误差模型(log-vMEM)的可扩展正则化估计方法。这些新方法通过采用分块坐标下降算法和分层滞后结构,解决了高维系统相关的计算挑战。为了进一步提高计算可扩展性,该研究还结合了GPU加速的求积积分,以克服对数似然数值积分步骤中的瓶颈。所提出的方法应用于微软股票的日内已实现波动率动态建模。

  19. TOOL · CL_284780 ·

    AEGIS 系统优化共享 GPU 上的深度学习训练

    研究人员开发了 AEGIS,一个运行时调度系统,旨在提高共享多 GPU 服务器上深度学习训练的效率。AEGIS 通过集成内存可行性检查、放置后观察和运行时压力过滤来管理多个深度学习工作负载的共置。与独占分配相比,这种方法旨在减少资源利用不足和排队时间,同时还能减轻不太复杂的共置方法可能出现的性能下降和内存不足故障。使用各种工作负载进行的评估表明,与独占分配相比,AEGIS 可将训练完成时间最多缩短 27%,与 Lucid 和 Horu…

  20. TOOL · CL_284295 ·

    BluffJAX 套件为不完美信息博弈中的强化学习带来新挑战

    研究人员开发了 BluffJAX,这是一个用 JAX 实现的对抗不完美信息博弈的开源套件。该套件专为高模拟吞吐量和 GPU 并行化而设计,提供了德州扑克和库恩扑克等既定基准的规范实现,以及诸如 Bluff、Stud Poker 和 Kemps 等研究较少的博弈。目标是通过基准测试性能和为各种算法提供基线结果,为博弈论方法中的强化学习研究带来新挑战,并促进比较。