NVIDIA H200
PulseAugur coverage of NVIDIA H200 — every cluster mentioning NVIDIA H200 across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
研究详细介绍了更快扩散语言模型的服务挑战
一篇新的 arXiv 研究论文探讨了服务掩码扩散语言模型(dLLM)的挑战,dLLM 通过同时去噪多个 token,可以比传统的自回归模型更快地生成文本。该研究使用 NVIDIA H200 GPU 上的 LLaDA-8B-Instruct 和 D2F LoRA 适配器,发现请求的难度是离散的,而不是连续的,请求分为 11 个固定的步数级别。具有较短生成预算的基准测试可能会低估服务方差,并且相当一部分挂钟时间花在 CPU 端的分发开销上…
-
Unitree Robotics在上海上市首日飙升629% 4个消息源追踪
中国机器人公司Unitree Robotics在上海证券交易所上市首日股价飙升高达629%,经历了非凡的上市表现。这一显著增长凸显了中国人工智能和机器人领域的持续热度,尽管其他全球市场正在降温。此次上市恰逢中国放宽对Nvidia H200芯片的限制,这标志着其在培养人工智能领导力方面采取了务实的态度。
-
Kog 的新引擎提升现有 GPU 的 AI 推理速度 · 已追踪 4 个来源
法国初创公司 Kog 开发了一款新的推理引擎,旨在显著加速现有数据中心 GPU(如 AMD MI300X 和 NVIDIA H200)上的 AI 模型性能。该公司的软件驱动方法旨在通过优化推理速度来绕过昂贵新硬件的需求,而推理速度已成为许多 AI 应用的关键瓶颈。Kog 的技术已引起了极大的商业兴趣,特别是来自软件工程等领域对当前 AI 延迟感到沮丧的专业用户。
-
AI 计算初创公司 B3IQ 向大学研究人员提供 GPU 的先租后买服务
初创公司 B3IQ 正在满足一个独特市场需求,通过提供一种先租后买模式的高性能 AI 计算硬件,专门面向大学研究人员。这种方法为学者提供了可预测的成本和增强的隐私性,这对于敏感的研究项目以及遵守 HIPAA 等法规至关重要。该公司由前 Coinbase 员工创立,已在斯坦福大学和纽约大学等机构获得客户,并正在探索与大学达成更广泛的批发协议。
-
AI 系统优化科学计算的 GPU 内核性能
研究人员开发了两个新颖的系统 SparseDitto 和 KernelBrain,旨在优化各种计算任务的 GPU 内核性能。SparseDitto 利用基于 LLM 的代理生成稀疏矩阵运算的自定义 GPU 内核,在 NVIDIA 硬件上实现了比 cuSPARSE 等现有库显著的加速。KernelBrain 采用粗粒度到细粒度、预算感知的搜索策略来优化 GPU 内核,与 PyTorch 和其他最先进的内核代理相比,提高了质量和效率。
-
新方法无需重新训练即可增强漫画图像编辑
研究人员开发了一种新的漫画图像编辑方法,该方法可以在无需重新训练的情况下调整现有的图像编辑模型。这种无需训练的方法通过修改编辑轨迹来在改变局部细节的同时保持图像的全局构图,这对于文本移除和网点合成等任务特别有用。该方法在特定的硬件配置上显示出最小的运行时和内存开销,分别报告了11%和0.1%的增加。
-
Thinking Machines 发布 Inkling-Small,性能超越更大模型
Thinking Machines Lab 推出了 Inkling-Small,这是一款新的开源多模态模型,它优先考虑效率而非单纯的规模。尽管比其前身 Inkling 体积小得多,Inkling-Small 在各种编码和推理基准测试中表现出卓越的性能。该模型设计用于更轻松的部署,能够在一台 GPU 上运行,并根据 Apache 2.0 许可证提供。
-
Kimi K3 AI模型优化GPU,设计芯片并加速研究
开放前沿智能(Open Frontier Intelligence)推出的先进AI模型Kimi K3,在超越典型语言任务方面展现了卓越的能力。该模型在优化GPU内核方面表现出色,学习速度提升高达2.48倍,并显著缩短了执行时间。它还成功开发了一个可与Triton和torch.compile相媲美的GPU编程系统,甚至参与了AI芯片的初步设计。此外,Kimi K3能够自主实现、验证和分析复杂的计算研究工作流,在短短几小时内完成通常需要人…
-
GMO首席执行官就远程工作禁令道歉,提及AI和办公价值
GMO Internet Group首席执行官熊谷正敏就其近期宣布完全废除远程工作的声明道歉,并澄清公司并非否定远程工作本身,而是否定其推荐远程工作的政策。熊谷解释说,真实意图是在AI时代重新定义办公室的价值,强调人类的创造力、讨论和学习通过面对面互动得到最佳培养。他还强调了GMO在AI方面的重大进展,包括70%的AI代理利用率和显著的时间节省,他认为这对于实现公司到2030年实现日本平均年薪最高的目标至关重要。
-
Moonshot AI 发布 Kimi K3,以开放权重挑战前沿 AI 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开放权重模型,拥有 100 万 token 的上下文窗口,使其成为前沿 AI 领域的有力竞争者。虽然基准测试表明 Kimi K3 的表现非常出色,尤其是在编码和代理任务方面,但一些分析表明它可能仍落后于领先的专有模型数月。该模型的发布预计将降低 AI 服务的成本,并为公司带来新的地缘政治和商业战略考量。
-
Thinking Machines 发布 Inkling,一款高效的多模态 MoE 模型
Thinking Machines 发布了 Inkling,这是一款新的开源、多模态混合专家(MoE)模型,拥有 9750 亿总参数和 410 亿活跃参数。该模型支持 100 万 token 的上下文窗口,并具有可控思考能力,允许用户调整推理成本。Inkling 旨在通过为企业用例提供效率和灵活性来与 Anthropic 和 OpenAI 等成熟的参与者竞争。
-
中国放宽对人工智能公司购买英伟达H200芯片的禁令,以应对全球竞争
据报道,中国政府正在放宽对包括阿里巴巴集团、字节跳动和DeepSeek在内的部分国内人工智能公司的NVIDIA H200芯片购买限制。此举标志着一种务实的做法,旨在解决保持在全球人工智能竞赛中竞争力的先进计算能力的即时需求。虽然政府仍优先考虑长期的技术自给自足,但它承认本地生产的替代品目前还无法弥合巨大的计算能力差距。
-
NVIDIA 发布 Nemotron VoiceChat 和 Parse 2.0 模型
NVIDIA 在 Hugging Face 上发布了两款新模型:NVIDIA NemotronLabs VoiceChat 11B,一个用于对话式 AI 的端到端实时语音模型,支持全双工交互和工具调用;以及 NVIDIA Nemotron Parse 2.0,一个用于文档理解和数据提取的多模态模型。VoiceChat 模型将语音理解和生成集成到单一架构中,降低了延迟,而 Parse 2.0 则增强了多语言支持、手写文本提取以及图表/表…
-
智谱AI的GLM-5.2模型已部署在无服务器GPU上
智谱AI发布了GLM-5.2,一个拥有7000亿参数的混合专家模型(MoE),在复杂推理和软件工程任务方面表现出色,据报道在某些基准测试中能媲美甚至超越Claude 3.5 Sonnet和GPT-4o等专有模型。由于其庞大的权重和上下文窗口,部署这个大型模型需要一个8x NVIDIA H200 GPU集群,这带来了显著的基础设施挑战。文章详细介绍了在无服务器GPU平台Modal上部署GLM-5.2的案例研究,强调了FP8量化在内存效率…
-
超级人工智能代理使用自玩 RL 主导 Generals.io
一篇新的研究论文详细介绍了为实时战略游戏 Generals.io 创建的超级人工智能代理。该代理在高端 GPU 上训练了四天,在超过 5,000 名人类玩家中达到了最高排名,并展示了对顶尖人类竞争对手的显著胜率。通过一个高度优化的、原生 JAX 的模拟器实现了这一开发,该模拟器达到了每秒数千万帧的速度,极大地减少了训练的数据瓶颈。
-
MegaFold系统提升3D注意力蛋白质模型训练效率
研究人员开发了MegaFold,一个旨在提高大规模3D注意力蛋白质模型训练效率的新系统。该方法解决了像AlphaFold3这样模型带来的显著计算和内存挑战,这些模型具有随序列长度呈立方增长的成本。MegaFold集成了内存高效内核、通信高效分片、融合算子和优化的主机-设备流水线,以提高GPU利用率。在NVIDIA H200和AMD MI250 GPU上的评估表明,MegaFold能够处理更长的序列并缩短整体执行时间。
-
MIMONet 使用神经算子实现对不可及系统的虚拟传感
研究人员开发了 MIMONet,一个新颖的基于算子的虚拟传感框架,专为安全关键系统(如核级热流体系统)中难以到达或不可测量参数的实时监控而设计。该方法利用神经算子从稀疏的边界测量中推断内部场,这与传统估计方法有所区别。在包括压水堆子通道和换热器在内的复杂场景中进行评估,MIMONet 在显著的传感器噪声下,仍能以低于 5% 的相对误差展现出高精度,并在 NVIDIA H200 硬件上实现了毫秒级的推理时间。
-
Flash-KMeans 加速 GPU k-means 聚类超 200 倍
来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 Flash-KMeans,这是一个开源库,可显著加速现代 AI 管道中的 k-means 聚类算法。通过优化 GPU 上的数据移动和重构算法的阶段,Flash-KMeans 实现了显著的加速,据报道在 NVIDIA H200 GPU 上比 FAISS 快 200 多倍,比 NVIDIA cuML 快 33 倍。该库在数学上与标准 k-means 保持一致,侧重于 IO 效…
-
旧智能手机被重新用作低成本计算平台
加州大学圣地亚哥分校的研究人员与Google合作,开发了一种将旧智能手机重新用作功能性计算平台的方法。通过拆解Pixel手机等设备至主板,并安装Linux发行版,他们创建了低成本的数据中心。这些由25-50部手机组成的集群可以匹配双插槽服务器CPU的单核性能,为教育机构和小型实体提供了成本效益高的解决方案。
-
Avataar AI 以全球成本的一小部分推出面向印度的 Varya 视频模型
Avataar AI 推出了 Varya,一款针对印度市场优化的新型视频生成模型。Varya 使用阿里巴巴的 Wan 2.2 进行蒸馏构建,速度更快、成本更低,每秒视频成本为 0.005 美元。该模型旨在理解印度的文化细微差别,并将作为开放权重模型在印度的 AI Kosh 门户上发布,这反映了政府为促进该国人工智能发展和可访问性而采取的更广泛举措。