Nvidia B200
PulseAugur coverage of Nvidia B200 — every cluster mentioning Nvidia B200 across labs, papers, and developer communities, ranked by signal.
- instance of graphics processing unit 95%
- instance of GB200 90%
- used by NVFP4 90%
- competes with atom 80%
- competes with Readonflow Team 80%
- competes with graphics card model series 80%
- used by NVIDIA H100 70%
- competes with NVIDIA H100 70%
- competes with H200 70%
- used by CUDA 70%
- used by SGLang 70%
- competes with Kimi k3 70%
12 天有情绪数据
-
腾讯与甲骨文签署70亿美元协议,采购10万颗离岸AI芯片
据报道,腾讯已与甲骨文达成一项为期五年的协议,租用其位于东南亚数据中心的约10万颗AI芯片,交易价值约70亿美元。此协议是在计算资源租用价格上涨的背景下达成的,预计每颗芯片每小时的成本约为1.60美元,远低于Nvidia H100或B200等高端GPU的当前市场价格。这些芯片在中国无法获得,该协议使腾讯能够获得离岸先进AI训练能力。
-
新基准 D2K-Bench 测试 LLM 代理的 GPU 内核设计能力
一项名为 D2K-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 代理将专家设计指导转化为高效 GPU 内核的能力。该基准包含 26 个任务和 85 个工作负载,评估了从高级算法、数据流设计到低级优化等方面的指导。在 NVIDIA B200 GPU 上的结果表明,专家指导显著提高了正确性和性能,像 GPT-6-ASTRA、Claude Opus 4-8 和 GPT 5.6 "Sol" 这样的前沿模型实现了大幅加速。
-
Aleph Alpha发布Kolibri,一个支持德语和英语的主权开源模型 · 跟踪8个来源
Aleph Alpha推出了Kolibri,这是一款新的开源、混合专家模型,总参数为781亿,但每个token仅有34.6亿活跃参数。Kolibri在德国开发,专为英语和德语任务设计,重点关注在公共管理和工业等监管行业的自主部署。该模型支持高达100万token的上下文窗口,并在Hugging Face上根据Apache 2.0许可证提供。
-
Aleph Alpha 发布 Kolibri,一个德语和英语的开源大语言模型
Aleph Alpha 发布了 Kolibri,一个专为德语和英语设计的开源大语言模型。这个专家混合模型拥有 781 亿参数,每个 token 仅激活一小部分。Kolibri 在大约 24 万亿个 token 上进行了训练,其中很大一部分是德语,使用了位于德国和芬兰的 768 个 NVIDIA B200 GPU。该模型在 Apache 2.0 许可下可用,其权重可在 Hugging Face 上找到。
-
autotrust 发布基于 Gemma-4 的决策模型 bf16 和 NVFP4 量化版本
autotrust/GEV-26B-Decide 模型基于 Gemma-4,发布了两个版本:标准的 bf16 模型和为 vLLM 优化的量化 NVFP4 版本。NVFP4 版本显著降低了内存需求,使其能够运行在 24GB GPU 上,并在 GPQA Diamond 和 HLE 等基准测试中保持与 bf16 版本相当的性能。该模型专为决策任务设计,具有自适应思考能力,仅在必要时进行推理,从而在 Nvidia B200 等硬件上实现快速推理。
-
Qwen 3.8 27B 基准测试揭示实际推理性能差异 · 跟踪 1 个来源
来自 g factor 的一份新基准测试报告评估了 Qwen 3.8 27B 模型在多个推理提供商(包括 Together AI、Fireworks AI 和 Doubleword)上的性能。该研究详细介绍了张量并行、数据并行和硬件配置(Nvidia H100 与 B200)等因素如何影响首个标记时间 (Time-To-First-Token) 和标记间延迟 (Inter-Token Latency) 等关键指标。研究结果强调,与供应…
-
NVIDIA CUDA 集成芝浦工业大学 Ozaki Scheme II 以加速科学计算
芝浦工业大学的“Ozaki Scheme II”已集成到 NVIDIA 的 CUDA Toolkit 13.4 中,使专注于 AI 的 GPU 能够执行高精度科学计算。这种基于软件的方法允许原本为低精度 AI 任务优化的现有 GPU 硬件用于关键的双精度 (FP64) 矩阵计算。Ozaki Scheme II 由 Katsuhisa Ozaki 教授及其同事开发,建立在早期的 Ozaki Scheme I 之上,并使用数学技术在无需新…
-
新研究提高了线性注意力的效率和性能
研究人员正在开发新方法来提高大型语言模型中线性注意力机制的效率和性能。一种方法,Switching Linear Attention (SwiLA),在保持固定大小的循环状态的同时增强了表示能力,与标准 softmax 注意力相比,取得了有竞争力的结果。另一项开发,LeapQuant,专注于线性注意力的精确循环状态量化,在推理中实现了显著的加速,且质量损失很小。此外,对线性注意力的理论分析表明,其循环状态通常具有低秩结构,这表明通过基…
-
新研究推动表格基础模型实现高效和鲁棒性
多篇研究论文探讨了表格基础模型(TFMs)的进展,重点关注提高其效率、鲁棒性和适应性。知识蒸馏等技术正被用于从大型TFM创建更小、更快的学生模型,而RelICL和VIP-COP等新方法则解决了关系学习和上下文优化中的挑战。此外,研究正在探索架构选择和参数高效适应策略,以增强TFM在亚群体偏移和大规模数据集等各种数据条件下的性能。
-
Nunchux AI 发布 VC-Attention 以加速视频扩散 Transformer
Nunchux AI 开发了 VC-Attention,这是一种新颖的、无需训练的低比特注意力核,旨在加速视频扩散 Transformer。这项创新解决了两个关键瓶颈:值量化误差和缓慢的 softmax 计算。通过实施 V-Smooth 等技术来管理值异常值,以及使用 ExpCast-FP8 进行高效的对数域指数运算,VC-Attention 显著加速了视频生成模型中的注意力机制。
-
Apple M5 Ultra 处理器泄露,挑战英伟达 AI 主导地位
苹果新款 M5 Ultra 处理器在泄露的 Geekbench 7 基准测试中显示,与前几代相比性能大幅提升,几乎是 M2 Ultra 系统输出的两倍。这种增强的处理能力使 Mac Studio 不仅仅是视频编辑工具,而是成为运行大型 AI 模型本地化的强大工作站。M5 Ultra 的能力,特别是其处理 Llama-3.1-405B 等拥有数千亿参数的模型的能力,与高端 NVIDIA GPU 相比,提供了比基于云的 AI 开发更私密且…
-
MiniMax H3视频生成速度达到2倍实时
MiniMax AI宣布其视频生成模型MiniMax H3取得了重大进展。该模型利用@sgl_project和VDN-H3,现在的去噪速度超过实时速度的两倍。这使得在不损失任何可察觉质量的情况下,使用八个Nvidia B200 GPU,仅用9.0秒即可生成14.4秒的768p视频。
-
MiniMax H3 视频生成在 Nvidia B200 上实现 2 倍加速
MiniMax AI 宣布其 H3 视频生成模型的速度得到显著提升。使用 SGLang-Diffusion 和 VDN-H3 在八个 Nvidia B200 GPU 上,该系统现在可以在 9.0 秒内生成 14.4 秒的 768p 视频。这代表了实时去噪速度的提升超过两倍,且视频质量没有明显下降。
-
VC-Attention 框架通过优化低比特注意力来加速视频生成
研究人员推出了一种新颖的 VC-Attention 框架,旨在提高扩散 Transformer 中注意力机制的效率和准确性,这对于最先进的视频生成至关重要。该方法解决了两个主要瓶颈:长序列导致的注意力计算成本以及 softmax 函数施加的速度限制。VC-Attention 采用双管齐下的方法:值平滑 (V-Smooth) 通过重新排序值 token 来减少量化误差,以及融合概率转换 (ExpCast-FP8),该方法绕过了 soft…
-
NVIDIA vLLM发布即支持DeepSeekv4.1 Flash;AMD vLLM滞后
NVIDIA的vLLM软件已与新的DeepSeekv4.1 Flash模型在所有六种硬件SKU上无缝运行,包括H100、H200、B200、B300、GB200和GB300。相比之下,尽管AMD强调速度,但其vLLM实现却遇到问题,并且尚未公开发布DeepSeekv4.1 Flash模型。这种差异凸显了两家硬件制造商在最新AI模型即时软件支持方面的不同。
-
Cohere 发布 218B MoE 翻译模型,North Small Translate
Cohere 悄然发布了 North Small Translate,这是一款拥有 2180 亿参数的混合专家(MoE)模型,专为机器翻译而设计。该稀疏模型每个 token 有 250 亿活跃参数,支持 50 种语言,并为翻译质量树立了新标杆,在 WMT26 上取得了 83.60 的分数。该模型的权重可在 Hugging Face 上用于研究和非商业用途,而生产部署则通过 Cohere 的 Model Vault 进行。此次发布标志着…
-
新POLCA系统将LLM服务效率提升20% · 跟踪2个来源
研究人员开发了一种新的分布式LLM服务电源控制系统,可优化GPU能效。该系统名为POLCA,将预填充和解码阶段的电源管理解耦,这与应用单一设置的NVIDIA Max-Q配置文件不同。POLCA的基于模型的校准方法在每焦耳的令牌数和降低延迟方面取得了显著改进,在Qwen3-Coder-480B和Qwen3-235B-A22B等特定模型上超越了供应商配置文件。
-
初创公司 VIDRAFT 的 LLM 在下载量上超越韩国大型企业
韩国初创公司 VIDRAFT 凭借其 POCKET-35B 语言模型获得了显著的关注,其下载量超过了 LG、Naver 和 Kakao 等大型、政府支持的企业。该模型在 Hugging Face 上 30 天内获得了超过 617,000 次下载,其受欢迎程度很大程度上是由国际开发者推动的,全球科技媒体和挑战赛认可了 VIDRAFT 的贡献。该公司专注于改编和优化现有模型,而不是从头开始训练,这一策略使其开源产品累计下载量超过 200 …
-
SemiAnalysis 发布 AgentX 数据集以用于代理推理
SemiAnalysis 发布了 AgentX,这是一个开源数据集,专为代理推理设计,具有 100 万个 token 的上下文长度和多轮对话能力。该数据集旨在测试 CUDA 在代理推理场景中的主导地位的韧性。它还强调了 GB300 NVL72、MI355 和 Nvidia B200 等硬件配置,表明这些对于此类高级推理任务是相关的。
-
2026年顶级GPU Neoclouds:CoreWeave、Nebius、Lambda、Crusoe、Groq排名
2026年GPU Neocloud提供商排名显示,CoreWeave是唯一获得铂金评级的选项,其高端NVIDIA GPU定价较高。Nebius在公布最新B300芯片的按需定价方面处于领先地位,而Lambda提供最实惠的B200费率。Crusoe的独特之处在于其定价列表中包含AMD的MI300X/MI355X,而Groq正逐步在其LPU推理云中加入NVIDIA GPU容量。