PulseAugur
实时 20:20:57
实体 NVIDIA H100

NVIDIA H100

PulseAugur coverage of NVIDIA H100 — every cluster mentioning NVIDIA H100 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
54
90 天内 192
发布 · 30天
0
90 天内 0
论文 · 30天
13
90 天内 51
层级分布 · 90 天
主题
关系
情绪 · 30 天

25 天有情绪数据

最近 · 第 1/10 页 · 共 192 条
  1. SIGNIFICANT · CL_224314 ·

    Google DeepMind 的 DiffusionGemma 使用并行块实现更快的文本生成

    Google DeepMind 发布了 DiffusionGemma,一个开源的AI模型,它以并行块而非顺序的方式生成文本,这与传统的逐token生成不同。这种块扩散方法允许模型同时优化整个文本片段,从而显著提高推理速度,据报道,在单个NVIDIA H100上比同类Gemma模型快四倍。DiffusionGemma模型基于Gemma 4 26B架构构建,拥有256K的上下文窗口,支持140多种语言,并能处理文本、图像和视频输入,所有这…

  2. TOOL · CL_222779 ·

    Databricks AI Runtime 提升 PyTorch 训练效率和弹性

    Databricks 改进了其 AI Runtime,以提高大规模 PyTorch 训练的效率和容错能力。该运行时专注于优化两个关键子系统:数据管道和检查点机制。通过解决这些领域的问题,Databricks 旨在最大限度地减少因数据饥饿或故障导致的 GPU 空闲时间,从而提高整体训练吞吐量并降低成本。新方法利用分布式检查点和异步保存,使频繁的状态保存几乎免费,显著提高了在大型训练作业中应对不可避免的 GPU 故障的弹性。

  3. TOOL · CL_222361 ·

    开发者寻求 Hugging Face 的替代方案,Together AI 和 Groq 等平台日益受到关注

    随着 Hugging Face 面临用户不满,开发者们正在探索用于托管和运行大型语言模型的替代平台。主要竞争者包括 Together AI 和 Fireworks AI,它们提供与 OpenAI 兼容的 API,并为 Llama 3.3-70B 等模型提供有竞争力的定价。对于那些优先考虑特定模型速度的用户,Groq 是一个亮点,而 RunPod 则为喜欢自行管理服务堆栈的用户提供最便宜的原始 GPU 访问。其他选项,如 OpenRou…

  4. TOOL · CL_221905 ·

    Fish Audio 实现 2100 万美元营收;Liquid AI 发布新的基准测试工具

    Fish Audio 最初是一个 GitHub 上的业余项目,但已迅速发展成为一项盈利业务,一年内创造了 2100 万美元的年收入。与此同时,Liquid AI 发布了一个名为 Pipette 的开源工具。该工具旨在为 AI 模型提供更真实的性能基准测试,将 NVIDIA H100 服务器等高端系统的能力与智能手机硬件的实际限制进行对比。

  5. TOOL · CL_221052 ·

    新基准测试LLM在GPU数据库查询优化方面的能力

    研究人员开发了DataKernelBench,这是一个旨在评估大型语言模型(LLM)针对GPU优化数据库查询能力的新基准。与专注于机器学习算子的现有基准不同,DataKernelBench解决了数据密集型数据库操作的独特挑战。该基准将SQL查询转换为PyTorch TorchPlan程序,使LLM能够使用CUDA或Triton优化特定的代码片段或整个查询。使用NVIDIA H100 GPU在TPC-H数据集上进行的初步测试表明,LLM…

  6. TOOL · CL_220929 ·

    Together AI 对决 TokenPAPA:高端基础设施 vs. 预算型 LLM 聚合

    Together AI 和 TokenPAPA 服务于 AI 市场的不同细分领域,Together AI 专注于高端基础设施、GPU 集群和企业级服务,而 TokenPAPA 通过单一 API 密钥提供超过 30 个模型的经济实惠的聚合器。TokenPAPA 在推理成本效益方面表现出色,以远低于 Together AI 的价格提供 DeepSeek V4 Flash 等模型。Together AI 的优势在于定制模型训练、微调和专用的…

  7. RESEARCH · CL_220508 ·

    Google Research 发布 GlucoFM,一款用于葡萄糖监测的双流基础模型

    Google Research 开发了 GlucoFM,一款用于持续葡萄糖监测 (CGM) 的新型基础模型。与以往将葡萄糖数据视为单一数据流处理的模型不同,GlucoFM 采用了双流设计,分别对较慢的血糖趋势和短期偏差进行建模。这种方法可以实现更具可迁移性的表示,并在各种代谢预测任务(包括糖尿病风险评估和胰岛素抵抗)上展现出优于现有基线模型的性能。

  8. RESEARCH · CL_219789 ·

    英伟达1.5万亿美元的AI芯片问题,财报未能解答

    英伟达最近的财报虽然强劲,但并未完全解答其AI芯片的长期需求问题。该公司的股价飙升是由对未来增长的预期驱动的,特别是其Blackwell平台,但持续的需求和竞争仍然是未知数。微软、Google、Amazon、Meta和OpenAI等主要参与者是重要客户,但市场也在关注AMD和Intel等竞争对手,以及台积电(TSMC)的供应链能力。

  9. COMMENTARY · CL_219757 ·

    GPU租金上涨,AI基础设施的复杂性超过了标准化进程

    即使是像NVIDIA H100这样的老款GPU,其租金也未如预期般下降,原因在于AI任务所需的复杂系统。与传统计算不同,AI工作负载高度依赖GPU与高速网络、存储和软件的集成才能高效运行。这种复杂的系统设计,常被称为“超级节点”,意味着AI计算的性能和成本不仅取决于GPU本身,还取决于整个基础设施维持高利用率和最大限度减少这些昂贵资产空闲时间的能力。

  10. TOOL · CL_218891 ·

    研究发现:KV 压缩比更多 GPU 更便宜,适用于 LLM 服务

    一篇新的研究论文比较了两种优化大型语言模型 (LLM) 服务的方法:张量并行和 KV 缓存压缩。该研究在 A100、A40 和 H100 硬件上模拟了性能,发现对于内存受限的 LLM 部署,KV 压缩比增加 GPU 数量更具成本效益。压缩提供了 1.20 倍至 2.00 倍的成本优势,而张量并行对于超出设备内存容量的模型以及降低延迟是必要的,尽管它会增加每 token 的延迟。

  11. SIGNIFICANT · CL_220681 ·

    Breeze TTS 2 开源模型在 TTS 基准测试中取得最高分

    开源文本到语音模型 Breeze TTS 2 已发布,在 Artificial Analysis TTS 排行榜上名列前茅,超越了专有系统。该模型支持超低延迟的实时交互,在 NVIDIA H100 上实现首个音频生成时间低于 40 毫秒。它提供了高级功能,如语音克隆、根据自然语言描述进行语音设计以及声乐事件集成,可在英语和中文中实现富有表现力的语音。

  12. TOOL · CL_213558 ·

    CoreWeave以高价领跑GPU云排名;Nebius提供最低H100价格 · 跟踪2个来源

    对顶级GPU云服务提供商的最新比较显示,CoreWeave是一个高端选择,是唯一获得铂金评级的提供商,价格溢价10-15%。Nebius Group提供最低的NVIDIA H100 GPU价格,并且是唯一发布B300 GPU价格的提供商。Lambda提供最实惠的B200 GPU价格,而Crusoe独特地提供AMD GPU,Groq最近与NVIDIA合作。

  13. SIGNIFICANT · CL_213482 ·

    2026年顶级GPU Neoclouds:CoreWeave、Nebius、Lambda、Crusoe、Groq排名

    2026年GPU Neocloud提供商排名显示,CoreWeave是唯一获得铂金评级的选项,其高端NVIDIA GPU定价较高。Nebius在公布最新B300芯片的按需定价方面处于领先地位,而Lambda提供最实惠的B200费率。Crusoe的独特之处在于其定价列表中包含AMD的MI300X/MI355X,而Groq正逐步在其LPU推理云中加入NVIDIA GPU容量。

  14. TOOL · CL_212102 ·

    FleetSieve 通过智能剖析优化 LLM 舰队配置

    研究人员开发了 FleetSieve,一种用于优化大型语言模型 (LLM) 舰队配置的新颖方法。该系统智能地选择要剖析的配置,旨在减少确定最佳张量并行度和下副本数量所需的计算资源。FleetSieve 联合建模容量和尾部延迟,当决策差距足够小时停止剖析,并在 NVIDIA H100 GPU 上展示了相对于随机剖析的节省效果。

  15. SIGNIFICANT · CL_211527 ·

    Liquid AI 通过 DSpark 投机性解码将 LFM2.5 模型速度提升高达 3.18 倍

    Liquid AI 发布了其 LFM2.5 系列的 DSpark 草稿模型,这些模型在不改变输出质量的情况下,将解码速度提高了高达 3.18 倍。该方法使用投机性解码,其中一个较小的草稿模型提出代币候选,然后由一个较大的目标模型进行验证。这种方法显著加快了推理速度,尤其适用于延迟至关重要的代理应用。这些模型可供自托管,并兼容 llama.cpp 和 SGLang 等工具。

  16. COMMENTARY · CL_208837 ·

    英伟达及竞争对手利用巨额资金制定AI标准,投资开源

    据报道,英伟达及其他主要科技公司正利用其雄厚的财力,在AI训练和推理市场建立事实标准。该战略涉及利用开源组件将互补技术商品化。此外,英伟达正积极从Kubernetes和Red Hat招募人才,表明其在开源项目上进行了大量的私人投资。

  17. COMMENTARY · CL_206775 ·

    本地AI基础设施作为云AI的低成本、私密替代方案出现

    2026年,本地优先与云端AI基础设施之间的争论日益激烈,本地解决方案为许多应用在成本、延迟和隐私方面提供了显著优势。虽然云AI提供了对前沿模型和易用性的访问,但由日益强大的开放权重模型和用户友好工具驱动的本地AI,正成为高流量任务、敏感数据处理和离线操作的可行且通常更经济的选择。决策取决于具体用例,结合本地AI和云AI优势的混合方法正变得越来越普遍。

  18. RESEARCH · CL_215745 ·

    新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源

    三篇新研究论文介绍了用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶级排名。

  19. TOOL · CL_204230 ·

    MiniMax-H3 通过 Sol-Attn 优化在 RTX 4090 上实现 4.44 倍加速

    MiniMax AI 宣布了其 MiniMax-H3 模型的性能改进,在 GeForce RTX 4090 硬件上实现了 4.44 倍的速度提升。这一增强归功于在其 Sol-Attn 框架中包含了一个优化的 SM89 CuTe DSL 内核。此外,通过利用 Sol-Engine 实现更广泛的硬件兼容性,MiniMax H3 的支持已扩展到 NVIDIA H100 和 A100 GPU。

  20. TOOL · CL_203973 ·

    新的DeaMoE架构提升LLM解码效率

    研究人员推出了一种新颖的混合专家(MoE)架构DeaMoE,旨在提高大型语言模型(LLM)的解码效率,尤其是在小批量场景下。这种新结构将专家分组到部门中,允许部门内的参数共享,同时保留单个专家的独特参数。DeaMoE采用两阶段路由策略,以最大限度地减少冗余专家加载,从而显著提高解码速度并减少内存使用。实验表明,DeaMoE可以将加载的权重减少高达50.9%,并在NVIDIA H100 GPU上实现高达2.00倍的速度提升。