A100
PulseAugur coverage of A100 — every cluster mentioning A100 across labs, papers, and developer communities, ranked by signal.
- 2026-08-12 product_launch CoreWeave signs a contract for NVIDIA A100 GPUs extending into 2029, highlighting the continued profitability and demand for older AI hardware. 来源
11 天有情绪数据
-
研究发现:AI计算验证受功耗限制
一篇新的研究论文探讨了使用功耗测量来验证人工智能计算限制的局限性,这是国际人工智能治理条约的一个关键方面。该研究推导出了一个关于 beta 的公式,beta 代表了功耗追踪无法排除的最大隐藏计算量,并发现 NVIDIA A100 GPU 上的测量结果提供了薄弱的约束。然而,额外的验证方法,例如重新执行声明工作量的能力,可以显著提高检测隐蔽计算的能力。
-
Mistral AI 发布 Mistral Large 4,采用开放权重和 100 万上下文 · 跟踪 4 个来源
Mistral AI 发布了 Mistral Large 4,这是一款新的 40 亿参数密集型 LLM,以更低的推理成本提供具有竞争力的性能。该模型可通过托管 API 和可下载的检查点获得,采用宽松的许可证,允许本地或边缘部署。主要优势包括由于其尺寸适合单个 GPU 而具有成本效益的扩展、开放权重许可证(与 Apache 2.0 兼容)以及通过与 OpenAI 兼容的端点和与 LangChain 和 LlamaIndex 等工具的集成…
-
新的QK-Wanda方法通过耦合查询和键来改进LLM剪枝
研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。
-
熵最优传输应用于大规模模拟和主动学习
两篇新研究论文探讨了熵最优传输(EOT)和Sinkhorn散度在不同AI场景中的应用。第一篇论文介绍了FlashSinkhorn 2 (FS2),一个基于GPU的大规模离散EOT问题求解器,能够处理来自模拟的海量数据集。第二篇论文利用Sinkhorn散度进行低预算主动学习,证明了其在为模型训练选择关键数据点方面的有效性,特别是在医学成像等领域。
-
天文学家将 22 个 AI 模型组合成 Gestalt,用于卓越的星系分析
研究人员在天文学领域开发了一种新颖的方法,创建了一个名为 Gestalt 的“元基础模型”,该模型结合了多个现有的基础模型以实现卓越的性能。该模型通过连接 22 个不同基础模型的嵌入(embeddings)并应用随机 SVD 构建而成,在估计物理特性和星系形态的 21 项测试指标中的 19 项上优于单个模型。该研究利用了詹姆斯·韦伯太空望远镜、DESI Legacy Survey 和 HSC 的图像,发现 Gestalt 的性能随着模…
-
vLLM标志在A100 GPU测试中将代币成本降低了68%
一位开发者使用A100 GPU和Qwen2.5-0.5B模型测试了一个vLLM标志`max_num_seqs`对代币成本的影响。通过交错测试运行以应对机器漂移,他们发现将`max_num_seqs`从1增加到8,成本显著降低了约68%。开发者指出,1的基线不切实际地低,并且结果可能因更大的模型和不同的流量模式而异。他们还发布了一个开源工具`throttle-pro`,以帮助其他人自信地测量代币成本。
-
新工具 `throttle-pro` 测量自托管 LLM 的 token 成本
一位开发者创建了一个名为 `throttle-pro` 的开源工具,用于精确测量自托管大型语言模型时每百万 token 的成本。该工具解决了由于批处理大小、引擎版本和 GPU 负载等变量导致性能和成本估算不一致的常见问题。通过运行多项测试并建立一个基准线,`throttle-pro` 帮助用户确定其设置的更改是否真正降低了成本,而不是将节省归因于随机波动。
-
DanLing NestedTensor 通过 PyTorch 抽象提高了深度学习效率
研究人员推出了 DanLing NestedTensor,这是一种用于 PyTorch 的新型张量抽象,旨在更有效地处理深度学习中可变大小的输入。这种抽象使多不规则结构成为张量本身的固有属性,减少了填充造成的计算浪费并提高了性能。基准测试显示,与传统的填充方法相比,对于包括 BERT 和 FCN 主干在内的各种深度学习模型,速度显著加快,并且在高变化批次中内存分配明显减少。
-
新研究推动表格基础模型实现高效和鲁棒性
多篇研究论文探讨了表格基础模型(TFMs)的进展,重点关注提高其效率、鲁棒性和适应性。知识蒸馏等技术正被用于从大型TFM创建更小、更快的学生模型,而RelICL和VIP-COP等新方法则解决了关系学习和上下文优化中的挑战。此外,研究正在探索架构选择和参数高效适应策略,以增强TFM在亚群体偏移和大规模数据集等各种数据条件下的性能。
-
报告:数十亿美元的英伟达AI芯片通过非法渠道流入中国 · 追踪到1个来源
来自先进国防研究中心(C4ADS)的一份报告详细说明了中国公司如何规避美国的出口限制,以获取价值数十亿美元的先进英伟达AI芯片。报告指出了三种主要方法:研究机构直接采购、通过越南等东南亚国家进行转运,以及复杂的空壳公司结构。尽管美国法规禁止向中国销售H100和A100等高端芯片,但据报道,这些芯片仍流入了中国实体手中,其中一些实体与中国共产党和国防部门有关联。走私硬件的实际数量可能远高于报告数字,估计中国相当一部分AI计算能力依赖于这…
-
新型FIVE-VLA模型提升自动驾驶效率和记忆能力
研究人员开发了FIVE-VLA,这是一种新颖的视觉-语言-动作模型,专为自动驾驶设计,可显著提高效率和时间记忆能力。该模型利用高效的视觉编码器处理高分辨率图像并生成更少的token,并结合了循环动作记忆(RAM)以根据过去的动作来条件化动作预测,这对于复杂机动至关重要。尽管参数量较少,FIVE-VLA在Bench2Drive等基准测试中表现优于先前最先进的模型,并在NVIDIA Physical AI AV数据集上展示了更低的碰撞率,…
-
万亿参数LLM可在消费级硬件上实现18小时临床肿瘤基因组分析
研究人员开发了一个框架,能够利用万亿参数大语言模型(LLM)对临床肿瘤诊断的全基因组测序(WGS)数据进行分析。该系统可以在消费级硬件(如GeForce RTX 4060笔记本电脑)上运行,并在18小时内完成整个WGS工作流程。该LLM实现了高精度,体细胞变异检测的F1得分为99.62%,通过降低全球医疗机构的计算成本和周转时间,展示了其在普及精准肿瘤学方面的潜力。
-
LLM推理优化研究详解成本-质量-延迟权衡 · 跟踪2个来源
两篇新研究论文探讨了大型语言模型(LLM)推理优化技术的权衡,重点关注成本、质量和延迟。第一篇论文《推理工程帕累托图集》(The Inference Engineering Pareto Atlas)分析了不同GPU上Qwen2.5-7B-Instruct的各种配置,发现组合优化方法比单独使用更有效。该论文强调,FP8权重在准确性和延迟之间提供了良好的平衡,而朴素的FP8 KV缓存则是有害的。第二篇论文《一种用于衡量推理优化如何影响输…
-
新工具和研究致力于 GPU AI 工作负载的优化
多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…
-
DSV4.1 LLM 优化后在 A100 GPU 上性能超越官方 API
据报道,一位用户已将 DSV4.1 大型语言模型优化,使其在 A100 GPU 上的运行速度超过了官方 API。此优化通过 GitHub 上的自定义实现完成,绕过了 A100 硬件在 FP4 精度方面的典型限制。
-
GPU-CFR 使用静态数据流和CUDA图实现遗憾最小化速度提升80倍
研究人员开发了GPU-CFR,一个新颖的编译器和运行时系统,旨在显著加速反事实遗憾最小化(CFR)计算。通过将游戏逻辑编译成静态数据流并利用CUDA图重放,GPU-CFR优化了执行序列,减少了框架操作,并实现了更快的迭代时间。这种方法使GPU-CFR在大型游戏中超越了先前的GPU实现和优化的CPU版本,实现了高达258倍的速度提升。
-
LLM推理服务器共享GPU内存以服务数百名用户
通过将大型语言模型的模型权重加载到GPU内存中一次,并跨所有请求共享它们,可以实现用单个GPU同时服务数百名用户。推理服务器管理此过程,利用连续批处理等技术来优化GPU利用率。虽然模型权重是只读的并且可以共享,但每个请求的状态,特别是KV缓存,是复制的,并最终限制了并发级别。
-
Axis Robotics 推出基于浏览器的机器人操作研究数据库引擎
Axis Robotics 推出了 AXIS,一个新颖的、基于浏览器的数据库引擎,旨在加速机器人操作研究。该系统允许通过 Web 界面进行连续数据收集,后端 GPU 负责处理训练和渲染等计算密集型任务。该数据集目前在 Hugging Face 上提供非商业学术用途,包含 207 个任务的 50,000 多条轨迹,通过程序化生成以确保多样性和可扩展性。初步结果表明,使用 AXIS 数据训练的模型在操作任务上的性能显著优于使用静态数据集训…
-
LLM 推理挑战:在有限的 GPU 内存中管理大型模型
由于内存需求巨大,在消费级硬件上运行大型语言模型面临挑战。诸如量化(降低模型权重的精度)和分片(将模型分割到多个 GPU 上)等技术被用来应对这些限制。理解模型大小、精度和各种并行策略之间的权衡对于高效推理至关重要。KV 缓存(存储上下文)等因素也会增加整体内存需求,因此在为特定 GPU 选择模型时,需要仔细考虑模型文件、量化级别和上下文长度。
-
LLM基准测试结果喜忧参半;Mastodon实例周日关闭
LLogiq 最近的一项分析评估了几种领先的大型语言模型(LLM)的性能,包括 Claude 3.5 Sonnet、GPT-4o、Claude 3 Opus、Claude 3 Haiku、Mistral Large、Llama 3-70B 和 Mixtral 8x22B。这些基准测试在 NVIDIA H100 和 A100 硬件上运行,结果显示,虽然一些模型表现出潜力,但总体结果有些令人失望,未能达到某些预期。另外,一个 Mastod…