Nvidia B200
PulseAugur coverage of Nvidia B200 — every cluster mentioning Nvidia B200 across labs, papers, and developer communities, ranked by signal.
- instance of graphics processing unit 90%
- instance of GB200 90%
- used by NVFP4 90%
- competes with MI355x 80%
- competes with Readonflow Team 80%
- competes with atom 80%
- competes with graphics card model series 80%
- used by NVIDIA H100 70%
- competes with NVIDIA H100 70%
- used by vLLM 70%
- used by SGLang 70%
- used by GB200 70%
14 天有情绪数据
-
SemiAnalysis 发布 AgentX 数据集以用于代理推理
SemiAnalysis 发布了 AgentX,这是一个开源数据集,专为代理推理设计,具有 100 万个 token 的上下文长度和多轮对话能力。该数据集旨在测试 CUDA 在代理推理场景中的主导地位的韧性。它还强调了 GB300 NVL72、MI355 和 Nvidia B200 等硬件配置,表明这些对于此类高级推理任务是相关的。
-
GPU云服务商排名:CoreWeave、Nebius、Lambda、Crusoe、Groq
一份新报告根据定价、合同算力和硬件路线图,对五家领先的GPU云服务商进行了排名:CoreWeave、Nebius、Lambda、Crusoe和Groq。CoreWeave凭借铂金级服务和最新NVIDIA GPU的高价位居榜首,而Nebius提供按需B300定价。Lambda提供最低的按需B200费率,Crusoe则独家提供AMD MI300X/MI355X。Groq,此前专注于其LPU架构,现已成为NVIDIA云合作伙伴,计划集成NV…
-
KernelArc 多智能体框架在 GPU 内核优化基准测试中名列前茅
研究人员推出 KernelArc,一个专为跨不同工作负载优化 GPU 内核而设计的新型多智能体框架。该框架利用专业智能体通过共享内存和基准测试守护进程进行协作,以提高性能。在 NVIDIA H100 和 B200 GPU 上使用 SOL-ExecBench 进行的评估表明,KernelArc 的性能优越,在所有评估的任务中均获得第一名。
-
Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战
Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…
-
NVIDIA发布具有100万上下文的Nemotron-Labs-Teacher模型 · 跟踪4个来源
NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。
-
CAKE框架协同设计编译器代理以促进GPU内核演进
研究人员开发了CAKE,一个新颖的协同设计框架,它整合了编译器技术和AI代理以增强GPU内核演进。该系统允许代理编写一种称为CAKE IR的专业中间表示(IR),该IR详细说明了硬件调度、内存移动和同步。该框架旨在提高专家GPU内核的可复现性和性能,超越将编译器视为黑箱的局限性。早期结果显示,在NVIDIA GPU上,Flash-KMeans和Kimi Delta Attention等应用程序的速度显著提升,并有可能实现更广泛的内核泛化。
-
NVIDIA与金融巨头合作,为超过5000亿美元的AI基础设施建设提供资金
NVIDIA正与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等主要金融机构合作,建立融资平台。这些平台旨在调动超过5000亿美元的第三方资本,以支持AI基础设施的扩展。这一举措标志着将AI工厂作为生产性基础设施资产进行融资的转变,类似于传统基础设施项目,利用NVIDIA的计算平台、CUDA等软件创新以及广泛的生态系统来确保长期价值和收入产生。
-
英伟达与华尔街合作,为 AI 基础设施融资超 5000 亿美元
英伟达 CEO 黄仁勋宣布了一项新的 AI 基础设施融资计划,将 GPU 计算能力定位为可投资的资产类别。英伟达正与 Apollo、BlackRock 和 Goldman Sachs 等主要金融公司合作,建立独立的融资平台,旨在调动超过 5000 亿美元的第三方资本。此举旨在资助“AI 工厂”的建设,这些工厂是旨在从能源和数据中生成智能的综合计算平台,类似于 AI 时代的发电厂。
-
NVIDIA 发布 NemotronLabs VoiceChat 11B,用于实时全双工 AI 对话
NVIDIA 推出了 NemotronLabs VoiceChat 11B,一个开源的全双工语音到语音模型,专为实时对话式 AI 设计。这个统一的模型集成了语音识别、语言理解和语音合成,实现了大约 448 毫秒的轮流延迟。一个关键特性是它能够在对话进行的同时执行工具调用,从而在不中断对话的情况下无缝集成外部功能。
-
用户声称超越英伟达B200性能基准测试
一位Mastodon用户声称,他在单个英伟达B200芯片上实现了并超越了LPU性能。该用户表示,这是在不添加任何组件或进行重大修改的情况下完成的。
-
Pokee AI 发布 28B 模型,拥有 10M token 上下文窗口,支持本地部署
Pokee AI 发布了 Pokee-Isaac 28B,这是一个拥有 280 亿参数的纯文本基础模型,专为部署在私有客户边界内而设计。该模型拥有 1000 万 token 的上下文窗口,使其能够在不离开安全环境的情况下保持连贯性并处理大量数据。Pokee-Isaac 28B 在智能体基准测试中表现强劲,在最大上下文长度下 RULER 得分为 93.3%,并且优于在超过 200 万 token 后性能下降的云端模型。
-
AMD MI355X GPU 为 Kimi K3 模型提供更优的每美元性能
来自 Wafer.ai 的一篇博文详细介绍了他们如何在 AMD 的 MI355X GPU 上运行 Kimi K3 模型,从而实现了更优的每美元性能。尽管 Kimi K3 拥有 2.8T 的巨大参数量,需要大量的 VRAM,但 MI355X 凭借其每个 GPU 288GB 的 VRAM,证明了其作为 NVIDIA B300 和 B200 GPU 的经济高效替代方案。虽然 NVIDIA 的硬件提供了更高的总吞吐量,但 MI355X 提供了…
-
AMD MI355X 内核优化显示性能提升 4 倍,但仍落后于竞争对手
AMD 和 GPU_MODE 社区最近组织的一次内核黑客马拉松,显著提升了 AMD MI355X 显卡的性能。据报道,Readonflow Team 的优化内核将 MI355X 的端到端上游性能提升了四倍多。尽管这一进展显示出希望,但 AMD 在 Kimi 模型上的 vLLM 性能仍落后于竞争对手,不过预计未来会有改进。
-
新兴 M3D 内存技术有望为 LLM 服务带来显著节能
研究人员开发了 LLMET,一个跨层仿真框架,用于评估新兴的单片 3D (M3D) 内存技术对大型语言模型 (LLM) 服务能效的影响。研究表明,显著增加片上缓存容量可将 LLM 预填充阶段的能耗降低高达 44%。例如,在双 NVIDIA A100 GPU 设置上将 L2 缓存从 40MB 扩展到 1GB,为 Llama3.1-70B 模型带来了显著的节能效果。
-
AMD MI355X 在 Kimi K2.5 模型上的 vLLM 性能超越 Nvidia B200
AMD 的 MI355X 图形卡在 Kimi K2.5 模型的 vLLM 基准测试中表现优于 Nvidia 的 B200,这是社区开发的内核驱动的重大成就。这一进步源于 AMD 和 GPU_MODE 组织的一项价值 110 万美元的内核黑客马拉松,通过在 MoE、Top-K 和张量并行内核方面的优化,使 MI355X 的端到端性能提高了 4 倍以上。虽然 AMD 在 Kimi 模型上的 vLLM 性能仍有差距,但这些已合并到 AMD …
-
Moonshot AI 发布 Kimi K3,拥有 2.8T 开放权重,但只有 1.8% 在运行
Moonshot AI 发布了 Kimi K3 模型,拥有 2.8 万亿开放权重,使其成为迄今为止最大的开放权重模型。然而,在这些参数中,只有一小部分,大约 1.8%,在处理每个 token 时被积极使用。这种稀疏性意味着,虽然该模型拥有庞大的参数数量,但实际的计算和内存需求与同等规模的密集模型相比要低得多,尽管仍然很大,需要大约 1488 GB 的 VRAM。
-
AMD MI355X 性能因社区黑客马拉松而提升,在 Kimi 模型上可与 B200 匹敌 · 跟踪 6 个来源
AMD 与 GPU_MODE 合作,启动了一个耗资 110 万美元的内核黑客马拉松,显著提升了其 MI355X 图形卡的性能。Readonflow Team 的优化专注于 MoE 内核和其他核心组件,带来了高达 4 倍的性能提升,并已合并到 AMD 的 AITER 内核库和 ATOM 推理引擎中。该计划旨在使 AMD 的 vLLM 性能接近 CUDA vLLM 的水平,并增强社区对 ROCm 堆栈的体验。
-
Sol-Attn 通过高效的稀疏注意力加速视频生成
研究人员开发了 Sol-Attn,一种新的无需训练的稀疏注意力方法,旨在加速视频生成模型的推理。与以往因僵化的路由或丢弃信息而难以兼顾效率和准确性的方法不同,Sol-Attn 在单次通过中统一了动态路由、稀疏计算和近似校正。这种方法允许动态但可控的块预算,而无需物化代理分数,并且它会重用未选定块的分数来近似其贡献。实验表明,Sol-Attn 在视频生成方面实现了高达 2.1 倍的速度提升,在视频编辑方面实现了 2.3 倍的速度提升,同…
-
Marker 2 文档转换器吞吐量达 5 倍,在基准测试中击败竞争对手
Datalab 发布了 Marker 2,这是一个经过重写的大幅改进的开源文档转换管道。新版本与 MinerU 相比,吞吐量提高了 5 倍,在单个 Nvidia B200 GPU 上达到每秒 2.9 页,并在 olmOCR-bench 上获得 76.0% 的分数。Marker 2 使用 Surya OCR 2 和更快的 pdftext 模块这三个核心组件重建,并提供针对质量、速度或纯 CPU 操作进行了优化的多种转换路径。
-
MiniMax AI 通过 AMD MI355X 优化,性能接近 NVIDIA B200
MiniMax AI 利用 AMD 的 MI355X 硬件,在其 Minimax M3 模型上实现了接近 NVIDIA B200 的性能。这一进展得益于 AMD 的 ATOM 和 ATOMesh 技术的全栈协同优化,具体细节已在近期技术博客中披露。此次优化特别有利于 MiniMax 的 428B MSA 稀疏 MoE 多模态基础模型,并采用了 EAGLE3 投机解码等技术以提高生成效率。