PulseAugur
中
实时 04:58:53
实体 H200

H200

PulseAugur coverage of H200 — every cluster mentioning H200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
67
90 天内 67
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-19 product_launch First shipments of Nvidia's H200 AI chips have reached China, with ByteDance and Tencent as initial recipients. 来源
  2. 2026-05-14 product_launch US government approves sale of NVIDIA H200 AI chips to ten Chinese companies.
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/4 页 · 共 75 条
  1. COMMENTARY · CL_282626 ·

    尽管路由和支付取得进展,代理经济仍面临结算缺口

    尽管在路由和支付机制方面取得了进展,但代理经济在其结算层面临着严峻的挑战。虽然像 AGTP-COMMERCE 这样的协议可以处理代理发现和验证,并且像 x402 这样的支付标准可以促进资金流动,但仍然缺乏一种在没有中介的情况下确保付款最终性的可靠方法。来自 Nevermined、Apex Fusion 和 Akash 等公司的现有解决方案提供了各种方法,但没有一种能明确证明计算工作的正确性。使用基于硬件的证明(如 NVIDIA 的 D…

  2. SIGNIFICANT · CL_281165 ·

    腾讯与甲骨文签署70亿美元协议,采购10万颗离岸AI芯片

    据报道,腾讯已与甲骨文达成一项为期五年的协议,租用其位于东南亚数据中心的约10万颗AI芯片,交易价值约70亿美元。此协议是在计算资源租用价格上涨的背景下达成的,预计每颗芯片每小时的成本约为1.60美元,远低于Nvidia H100或B200等高端GPU的当前市场价格。这些芯片在中国无法获得,该协议使腾讯能够获得离岸先进AI训练能力。

  3. TOOL · CL_277635 ·

    英伟达的证明可能实现人工智能算力结算的加密证明

    目前,人工智能代理的算力结算过程基于活跃度、声誉或支付渠道状态等代理,这些代理无法验证工作是否正确执行。英伟达在Hopper级硬件上的机密计算通过硬件融合的设备身份密钥和远程证明服务提供了一个解决方案。该服务可以生成加密签名的报告,证明哪些代码在特定的硅片上运行,从而实现一种新的结算机制,其中付款以在受信任的执行环境中正确执行工作负载的加密证明为门槛。

  4. TOOL · CL_277263 ·

    新的QK-Wanda方法通过耦合查询和键来改进LLM剪枝

    研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。

  5. TOOL · CL_272912 ·

    主要平台 GPU 租金价格每日波动 · 追踪 6 个来源

    GPU 租金价格在各大平台每日波动,其中 Tesla V100 和 RTX A6000 等特定型号价格变化显著。例如,在 2026 年 10 月初的五天内,Vast.ai 上的 32GB Tesla V100 价格在 $0.094/小时至 $0.151/小时之间波动。其他高 VRAM GPU,如 80GB A800 PCIE 和 192GB MI300X 在此期间价格相对稳定,而一些消费级显卡如 RTX 2060S 和 GTX 166…

  6. TOOL · CL_269092 ·

    Nebius 与 Nvidia 启动 2026 实体AI奖项,提供总计75万美元计算积分

    Nebius Group 与 Nvidia 合作,启动了 2026 Nebius 实体AI奖项,为拥有可验证实体AI产品的初创公司设立了五个不同类别。五位获奖者每位将获得价值15万美元的 Nebius 计算积分,以及推广支持、高管指导和独家社交机会。申请截止日期为2026年10月25日,获奖者将于11月中旬公布。

  7. RESEARCH · CL_269171 ·

    英伟达CEO对特朗普AI政策的影响引发对华芯片销售担忧

    据报道,英伟达CEO黄仁勋正影响前总统特朗普对AI监管和对华销售的立场。专家们担心,这种密切关系可能导致出口管制放松,从而允许中国获得大量英伟达先进AI芯片。此举可能提振英伟达的收入,但也可能将关键芯片供应从国内AI发展中转移出去,引发对保持前沿AI竞争优势的担忧。

  8. RESEARCH · CL_259942 ·

    报告:数十亿美元的英伟达AI芯片通过非法渠道流入中国 · 追踪到1个来源

    来自先进国防研究中心(C4ADS)的一份报告详细说明了中国公司如何规避美国的出口限制,以获取价值数十亿美元的先进英伟达AI芯片。报告指出了三种主要方法:研究机构直接采购、通过越南等东南亚国家进行转运,以及复杂的空壳公司结构。尽管美国法规禁止向中国销售H100和A100等高端芯片,但据报道,这些芯片仍流入了中国实体手中,其中一些实体与中国共产党和国防部门有关联。走私硬件的实际数量可能远高于报告数字,估计中国相当一部分AI计算能力依赖于这…

  9. TOOL · CL_258754 ·

    Nunchux AI 发布 VC-Attention 以加速视频扩散 Transformer

    Nunchux AI 开发了 VC-Attention,这是一种新颖的、无需训练的低比特注意力核,旨在加速视频扩散 Transformer。这项创新解决了两个关键瓶颈:值量化误差和缓慢的 softmax 计算。通过实施 V-Smooth 等技术来管理值异常值,以及使用 ExpCast-FP8 进行高效的对数域指数运算,VC-Attention 显著加速了视频生成模型中的注意力机制。

  10. RESEARCH · CL_251989 ·

    新工具和研究致力于 GPU AI 工作负载的优化

    多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…

  11. RESEARCH · CL_254962 ·

    VC-Attention 框架通过优化低比特注意力来加速视频生成

    研究人员推出了一种新颖的 VC-Attention 框架,旨在提高扩散 Transformer 中注意力机制的效率和准确性,这对于最先进的视频生成至关重要。该方法解决了两个主要瓶颈:长序列导致的注意力计算成本以及 softmax 函数施加的速度限制。VC-Attention 采用双管齐下的方法:值平滑 (V-Smooth) 通过重新排序值 token 来减少量化误差,以及融合概率转换 (ExpCast-FP8),该方法绕过了 soft…

  12. TOOL · CL_249532 ·

    新指标量化LLM训练功率弹性,以实现响应电网的AI基础设施

    一项新的研究论文介绍了“作业功率弹性”的概念,用于表征LLM训练性能如何受到GPU功率降低的影响。该研究提出了“功率弹性指数”(PFI)来量化这种敏感性,并展示了其在功率约束下优化总tokens/秒吞吐量的效用。研究结果表明,LLM训练作业表现出显著但可变的功率弹性,与等权重分配相比,PFI感知分配能够恢复可观的性能。

  13. SIGNIFICANT · CL_248977 ·

    NVIDIA vLLM发布即支持DeepSeekv4.1 Flash;AMD vLLM滞后

    NVIDIA的vLLM软件已与新的DeepSeekv4.1 Flash模型在所有六种硬件SKU上无缝运行,包括H100、H200、B200、B300、GB200和GB300。相比之下,尽管AMD强调速度,但其vLLM实现却遇到问题,并且尚未公开发布DeepSeekv4.1 Flash模型。这种差异凸显了两家硬件制造商在最新AI模型即时软件支持方面的不同。

  14. TOOL · CL_248458 ·

    Qwen 3 4B Base模型经过谜题微调后,在MATH-500上提升31%

    Qwen 3 4B Base模型的一个微调版本在用100个斑马谜题训练后,在MATH-500基准测试上表现出31%的提升。复现此结果的过程(在单块NVIDIA H100或H200 GPU上耗时约6.5分钟)已公开。这表明专门的微调可以显著提高模型在特定推理任务上的性能。

  15. COMMENTARY · CL_244271 ·

    自托管 LLM:隐藏的成本和利用率挑战

    在选择使用闭源前沿 LLM API、托管的开源模型 API,还是自托管开源模型之间做决定是一个复杂的问题。虽然自托管可能因为较低的每 token 成本而显得更具成本效益,但实际节省的成本在很大程度上取决于 GPU 的利用率,而在生产环境中,GPU 的利用率通常很低。像升级和调试这样的运营开销也会增加显著的成本,从而将盈亏平衡点推高很多,特别是与托管的开源模型服务相比。

  16. COMMENTARY · CL_237420 ·

    加密货币 GPU 租赁经济学:托管大型语言模型与挖矿的比较

    将 GPU 出租用于加密货币挖矿和托管 AI 模型呈现出复杂的经济格局。虽然出租个人 GPU 可以带来可观的日回报,但电力成本、折旧和低利用率等因素会显著降低净利润,使其成为仅为此目的购买硬件的投资的疑问。相反,在去中心化网络上托管 GLM-5.2 等大型语言模型,与超大规模云服务商相比,可节省大量成本,每小时可节省 55-70%。然而,对于个人用户而言,每 token 的实际成本可能远高于广告宣传的总吞吐量指标,API 成本通常比聚…

  17. TOOL · CL_231530 ·

    LLM 通过高效 NER 训练加速波斯语聊天匿名化

    研究人员开发了一种使用 LLM 标注数据对波斯语客户聊天进行高效匿名化的方法。他们比较了三种指令微调的 LLM——DeepSeek-V3-0324、GPT-OSS-120B 和 Qwen3-235B-A22B-Instruct-2507——来为训练紧凑型命名实体识别 (NER) 模型生成标注。研究发现,在零样本设置下,GPT-OSS-120B 的监督使训练好的 NER 模型表现最佳,实现了高宏观 F1 分数和标签覆盖召回率。这种方法能…

  18. TOOL · CL_238440 ·

    GLM-5.3 网络安全变体发布,拒绝率降低

    dealignai 发布了 GLM-5.3 模型的新网络安全专用变体,名为 GLM-5.3-CYBERSECURITY-FP8。该模型旨在减少在进攻性安全任务、红队演练和漏洞利用开发方面的拒绝情况,同时保持对自残等主题的安全合规性。它在 NVIDIA Hopper 架构上提供原生 FP8 速度,并兼容 vLLM 进行部署。

  19. TOOL · CL_219077 ·

    新的码本布局可在单 GPU 上实现大规模自组织映射

    研究人员开发了一种新颖的特征主导码本布局,用于稀疏二元自组织映射,显著提高了内存效率和训练速度。这种优化使得创建更大的图谱成为可能,能够扩展到单台消费级 GPU 上的 100 万个以上神经元。新方法比现有实现方式快得多,能够训练以前因内存限制而无法实现的 MEDLINE 大规模图谱。

  20. COMMENTARY · CL_215707 ·

    科大讯飞CEO:国内算力限制长上下文,落后英伟达H200

    科大讯飞CEO刘庆峰表示,国内算力限制正在阻碍AI模型极长上下文窗口的发展。他还指出,公司在训练效率方面落后于英伟达的H200多达五倍。为应对这些限制,科大讯飞正专注于优化其模型和框架,以最大限度地提高现有硬件上的性能。