Nvidia A100
PulseAugur coverage of Nvidia A100 — every cluster mentioning Nvidia A100 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究解决 LLM 训练效率、容错和微调优化问题 · 跟踪 9 个来源
arXiv 上发布的多篇研究论文探讨了优化大型语言模型 (LLM) 训练和微调的新方法。Leto 引入了一个系统,用于在 LLM 训练期间从硬件故障中更快地就地恢复,显著提高了生产性训练时间。其他论文侧重于高效的微调技术,包括使用 LOOM 进行在线数据选择,使用零阶和一阶优化方法 (ZFO) 进行自适应步长选择,以及使用 LoRA-Norm 进行训练后归一化以平衡适应性增益。此外,TACO 为 LLM 微调提供了一种内存高效的优化器…
-
具身化方法为 GNN 实现零样本链接预测
研究人员开发了一种名为“具身化”的新颖方法,使图神经网络(GNN)能够在未见过的图上执行零样本链接预测。该技术将图数据转换为固定元关系词汇表,使标准 GNN 能够在没有专门架构的情况下迁移知识。实验表明,使用此方法训练的基础图注意力网络(GAT)在链接预测任务上的表现可以媲美专用基础模型,并显示出应用于关系数据库的潜力。
-
Kolmogorov-Arnold网络在HPC训练中表现出强大的可扩展性
一篇新的研究论文分析了Kolmogorov-Arnold网络(KANs)在高性能计算系统上训练的可扩展性。该研究在FinisTerrae III超级计算机上进行,使用了多达8个NVIDIA A100 GPU,发现KAN训练实现了显著的并行效率,可与传统的深度学习工作负载相媲美。研究还分析了通信开销和模型大小扩展性,为最佳GPU拓扑和模型选择提供了部署指南。
-
新的GPU求解器加速符号回归常数优化
研究人员开发了一种新颖的GPU常驻求解器,用于通过基于树的遗传编程优化符号回归中的常数。这种批量Levenberg-Marquardt求解器能够以每次迭代最少的CUDA启动次数,高效地处理异构表达式树种群。它利用反向模式自动微分来组装雅可比矩阵,并采用双精度保护来确保常数质量,在NVIDIA A100硬件上实现了高吞吐量,并优于现有方法。
-
SatDL框架优化卫星AI训练,缩短时间和能源消耗
研究人员开发了SatDL,一个用于卫星分布式学习的新框架,该框架同时优化了数据重分布和训练过程。该方法旨在最大限度地减少端到端的总学习时间和降低能源消耗,这是由于轨道上非独立同分布(non-IID)数据和通信延迟带来的关键挑战。使用Starlink星座的模拟和硬件仿真进行的评估表明,在保持高推理精度的同时,学习时间和能源使用量显著减少。
-
AI 管道助力识别古代埃兰楔形文字符号
研究人员开发了 EpigraphNet,一个用于从退化碑文图像中识别埃兰楔形文字符号的新型管道。该系统利用零样本 SAM2 分割来创建干净的符号掩码,然后由经过微调的 Vision Transformer (ViT-B/16) 进行分类处理。EpigraphNet 的性能显著优于现有的 CNN 和 Transformer 基线模型,在 132 类基准测试中取得了 86.41% 的 top-1 准确率,并展示了对常见和罕见符号更均衡的识别能力。
-
新的稀疏注意力方法提高了 Transformer 处理长上下文的效率 · 跟踪 4 个来源
研究人员正在开发新方法来提高 Transformer 语言模型的效率,尤其是在处理长上下文方面。一种名为 BF1 的方法,通过确定性的块对齐稀疏注意力机制对现有模型进行改造,与密集注意力相比,显著加快了预填充时间并提高了训练困惑度。另一种方法侧重于使用稀疏注意力策略对模型进行微调,使其能够适应并优于使用精确注意力训练的模型,名为 KeysAndValues 的开源库促进了这些长上下文推理和微调任务。此外,还开发了一种名为 Sparse…
-
NVIDIA与金融巨头合作,为超过5000亿美元的AI基础设施建设提供资金
NVIDIA正与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等主要金融机构合作,建立融资平台。这些平台旨在调动超过5000亿美元的第三方资本,以支持AI基础设施的扩展。这一举措标志着将AI工厂作为生产性基础设施资产进行融资的转变,类似于传统基础设施项目,利用NVIDIA的计算平台、CUDA等软件创新以及广泛的生态系统来确保长期价值和收入产生。
-
AI供应商锁定隐藏成本明细:迁移、再培训和停机时间
从Amazon Bedrock、Google Vertex AI或Azure OpenAI等AI平台迁移会产生除初始API费用之外的巨额隐藏成本。这包括数据转换和代码重构所需的大量工程工作,据估计,一个4人团队在数月内可能花费数十万美元。模型再培训、数据重新格式化以及多次实验的计算成本也会产生额外费用,可能高达数万美元。此外,迁移过程可能导致暂时性停机、性能下降和收入损失,据估计每周损失的价值可能高达数十万美元。
-
北大发布比NVIDIA A100快478倍的神经形态芯片
北京大学和中国科学院的研究人员开发了一种新颖的神经形态芯片,其性能显著优于NVIDIA的A100 GPU。该相变忆阻器芯片的详细信息发表在《Science》杂志上,其计算延迟为2.12毫秒,在脑皮层重建任务上的速度比A100快50到478倍。
-
YOLO26 基准测试:边缘 AI 性能因硬件和数据而异
一项新的基准研究评估了 YOLO26 目标检测架构在水产养殖边缘部署方面与前代模型 YOLOv5u、YOLOv8 和 YOLO11 的对比。虽然所有模型在有足够训练数据的情况下都达到了可比的检测精度,但在数据效率和推理性能方面出现了显著差异。YOLO26 nano 变体在 Raspberry Pi 5 上展现了最高的推理速度,而 YOLOv5mu 在基于 CPU 的硬件上表现最佳。研究结论认为,实际边缘 AI 应用的模型选择应在考虑架…
-
面向FPGA的新型Transformer架构实现高压缩率
研究人员开发了ELiTeFormer,这是一种新颖的Transformer模型架构,专门为在现场可编程门阵列(FPGA)上高效部署而设计。该架构统一了混合线性注意力与超低精度三元线性投影,实现了显著的模型权重和KV缓存压缩。与部署在硬件上的现有模型(如LLaMA 3)相比,ELiTeFormer在准确性方面具有竞争力,并在延迟和能效方面提供了实质性改进。
-
北京大学发布世界首个大脑速度神经动力学芯片 · 跟踪到2个来源
北京大学的研究人员与中国科学院合作,开发出了世界首个神经动力学芯片。该新型芯片利用相变忆阻器模仿大脑般的处理速度,实现了2.12毫秒的延迟。在脑模型任务中,该芯片比NVIDIA A100 GPU的速度提升高达478倍。
-
新研究探讨 LLM 效率,从移动推理到训练稳定性
研究人员正在探索各种方法来提高大型语言模型 (LLM) 的效率和性能。一种名为“Thinking Seeds”的方法使用历史检查点来提高 LLM 中强化学习的稳定性和探索性。另一个重点是优化移动设备上的 LLM 推理,研究人员分析了神经处理单元 (NPU)、中央处理单元 (CPU) 和图形处理单元 (GPU) 中的瓶颈,以降低能耗。此外,还在开发“Full-Stack FP4”等技术,以使用 4 位精度实现稳定的 LLM 预训练,而“…
-
NVIDIA 发布 Nemotron VoiceChat 和 Parse 2.0 模型
NVIDIA 在 Hugging Face 上发布了两款新模型:NVIDIA NemotronLabs VoiceChat 11B,一个用于对话式 AI 的端到端实时语音模型,支持全双工交互和工具调用;以及 NVIDIA Nemotron Parse 2.0,一个用于文档理解和数据提取的多模态模型。VoiceChat 模型将语音理解和生成集成到单一架构中,降低了延迟,而 Parse 2.0 则增强了多语言支持、手写文本提取以及图表/表…
-
Gemma 12B 模型部署在 Azure Container Apps 上,使用 NVIDIA A100
本文详细介绍了在 Azure Container Apps 上部署 Gemma 12B 模型的分步指南,利用 NVIDIA A100 GPU 提升性能。该指南侧重于在无服务器环境中的实际实现和调试。
-
DeepSeek-R1 LLM 集成到俄罗斯 ARM64 服务器和 NVIDIA A100
一家俄罗斯公司 E-Flops 成功将 DeepSeek-R1 大型语言模型集成到一台配备国产 ARM64 处理器和 NVIDIA A100 GPU 的服务器上。由于需要在隔离的安全环境中运行,这使得本地部署 LLM 而非基于云的解决方案成为一项特别的挑战。该公司分享了他们的过程和结果,强调了这种设置的非平凡性。
-
新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源
多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。
-
Gemma 12B 模型部署在 Azure Container Apps 上,使用 NVIDIA A100
本文提供了在 Azure Container Apps 上部署 Gemma 12B 模型的分步指南,利用 NVIDIA A100 硬件。该指南侧重于无服务器执行的部署过程调试。
-
新的神经网络架构应对复杂的科学计算问题 · 跟踪 8 个来源
研究人员正在开发新颖的神经网络架构来求解复杂的偏微分方程 (PDE) 和建模动力学系统。这包括用于离子传输的面向结构的随机神经网络 (SO-RaNN),用于具有已知图结构的_时间序列_预测的_信息_神经_控制_微分方程 (INDEQS),以及用于高保真 PDE 解的_启动器-迭代器_神经算子 (SINO)。此外,还提出了正交正则化 (OrthoReg) 来通过防止组件之间的重叠来改进混合符号-神经模型,而其他工作则探索了现代神经网络架…