Nvidia A100
PulseAugur coverage of Nvidia A100 — every cluster mentioning Nvidia A100 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
SatDL框架优化卫星学习,缩短时间和能源消耗
一个名为SatDL的新框架已被开发出来,用于优化卫星分布式学习的数据重分布和训练。该方法旨在通过联合建模数据传输延迟和训练时间来减少端到端的总学习时间与能源消耗。使用Starlink星座的模拟和硬件仿真进行的评估表明,在保持具有竞争力的推理准确性的同时,学习时间和能源使用量显著减少。
-
AI 管道助力识别古代埃兰楔形文字符号
研究人员开发了 EpigraphNet,一个用于从退化碑文图像中识别埃兰楔形文字符号的新型管道。该系统利用零样本 SAM2 分割来创建干净的符号掩码,然后由经过微调的 Vision Transformer (ViT-B/16) 进行分类处理。EpigraphNet 的性能显著优于现有的 CNN 和 Transformer 基线模型,在 132 类基准测试中取得了 86.41% 的 top-1 准确率,并展示了对常见和罕见符号更均衡的识别能力。
-
新的稀疏注意力方法提高了 Transformer 处理长上下文的效率 · 跟踪 4 个来源
研究人员正在开发新方法来提高 Transformer 语言模型的效率,尤其是在处理长上下文方面。一种名为 BF1 的方法,通过确定性的块对齐稀疏注意力机制对现有模型进行改造,与密集注意力相比,显著加快了预填充时间并提高了训练困惑度。另一种方法侧重于使用稀疏注意力策略对模型进行微调,使其能够适应并优于使用精确注意力训练的模型,名为 KeysAndValues 的开源库促进了这些长上下文推理和微调任务。此外,还开发了一种名为 Sparse…
-
NVIDIA与金融巨头合作,为超过5000亿美元的AI基础设施建设提供资金
NVIDIA正与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等主要金融机构合作,建立融资平台。这些平台旨在调动超过5000亿美元的第三方资本,以支持AI基础设施的扩展。这一举措标志着将AI工厂作为生产性基础设施资产进行融资的转变,类似于传统基础设施项目,利用NVIDIA的计算平台、CUDA等软件创新以及广泛的生态系统来确保长期价值和收入产生。
-
AI供应商锁定隐藏成本明细:迁移、再培训和停机时间
从Amazon Bedrock、Google Vertex AI或Azure OpenAI等AI平台迁移会产生除初始API费用之外的巨额隐藏成本。这包括数据转换和代码重构所需的大量工程工作,据估计,一个4人团队在数月内可能花费数十万美元。模型再培训、数据重新格式化以及多次实验的计算成本也会产生额外费用,可能高达数万美元。此外,迁移过程可能导致暂时性停机、性能下降和收入损失,据估计每周损失的价值可能高达数十万美元。
-
北大发布比NVIDIA A100快478倍的神经形态芯片
北京大学和中国科学院的研究人员开发了一种新颖的神经形态芯片,其性能显著优于NVIDIA的A100 GPU。该相变忆阻器芯片的详细信息发表在《Science》杂志上,其计算延迟为2.12毫秒,在脑皮层重建任务上的速度比A100快50到478倍。
-
YOLO26 基准测试:边缘 AI 性能因硬件和数据而异
一项新的基准研究评估了 YOLO26 目标检测架构在水产养殖边缘部署方面与前代模型 YOLOv5u、YOLOv8 和 YOLO11 的对比。虽然所有模型在有足够训练数据的情况下都达到了可比的检测精度,但在数据效率和推理性能方面出现了显著差异。YOLO26 nano 变体在 Raspberry Pi 5 上展现了最高的推理速度,而 YOLOv5mu 在基于 CPU 的硬件上表现最佳。研究结论认为,实际边缘 AI 应用的模型选择应在考虑架…
-
面向FPGA的新型Transformer架构实现高压缩率
研究人员开发了ELiTeFormer,这是一种新颖的Transformer模型架构,专门为在现场可编程门阵列(FPGA)上高效部署而设计。该架构统一了混合线性注意力与超低精度三元线性投影,实现了显著的模型权重和KV缓存压缩。与部署在硬件上的现有模型(如LLaMA 3)相比,ELiTeFormer在准确性方面具有竞争力,并在延迟和能效方面提供了实质性改进。
-
北京大学发布世界首个大脑速度神经动力学芯片 · 跟踪到2个来源
北京大学的研究人员与中国科学院合作,开发出了世界首个神经动力学芯片。该新型芯片利用相变忆阻器模仿大脑般的处理速度,实现了2.12毫秒的延迟。在脑模型任务中,该芯片比NVIDIA A100 GPU的速度提升高达478倍。
-
新研究探讨 LLM 效率,从移动推理到训练稳定性
研究人员正在探索各种方法来提高大型语言模型 (LLM) 的效率和性能。一种名为“Thinking Seeds”的方法使用历史检查点来提高 LLM 中强化学习的稳定性和探索性。另一个重点是优化移动设备上的 LLM 推理,研究人员分析了神经处理单元 (NPU)、中央处理单元 (CPU) 和图形处理单元 (GPU) 中的瓶颈,以降低能耗。此外,还在开发“Full-Stack FP4”等技术,以使用 4 位精度实现稳定的 LLM 预训练,而“…
-
NVIDIA 发布 Nemotron VoiceChat 和 Parse 2.0 模型
NVIDIA 在 Hugging Face 上发布了两款新模型:NVIDIA NemotronLabs VoiceChat 11B,一个用于对话式 AI 的端到端实时语音模型,支持全双工交互和工具调用;以及 NVIDIA Nemotron Parse 2.0,一个用于文档理解和数据提取的多模态模型。VoiceChat 模型将语音理解和生成集成到单一架构中,降低了延迟,而 Parse 2.0 则增强了多语言支持、手写文本提取以及图表/表…
-
Gemma 12B 模型部署在 Azure Container Apps 上,使用 NVIDIA A100
本文详细介绍了在 Azure Container Apps 上部署 Gemma 12B 模型的分步指南,利用 NVIDIA A100 GPU 提升性能。该指南侧重于在无服务器环境中的实际实现和调试。
-
DeepSeek-R1 LLM 集成到俄罗斯 ARM64 服务器和 NVIDIA A100
一家俄罗斯公司 E-Flops 成功将 DeepSeek-R1 大型语言模型集成到一台配备国产 ARM64 处理器和 NVIDIA A100 GPU 的服务器上。由于需要在隔离的安全环境中运行,这使得本地部署 LLM 而非基于云的解决方案成为一项特别的挑战。该公司分享了他们的过程和结果,强调了这种设置的非平凡性。
-
新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源
多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。
-
Gemma 12B 模型部署在 Azure Container Apps 上,使用 NVIDIA A100
本文提供了在 Azure Container Apps 上部署 Gemma 12B 模型的分步指南,利用 NVIDIA A100 硬件。该指南侧重于无服务器执行的部署过程调试。
-
新的神经网络架构应对复杂的科学计算问题 · 跟踪 8 个来源
研究人员正在开发新颖的神经网络架构来求解复杂的偏微分方程 (PDE) 和建模动力学系统。这包括用于离子传输的面向结构的随机神经网络 (SO-RaNN),用于具有已知图结构的_时间序列_预测的_信息_神经_控制_微分方程 (INDEQS),以及用于高保真 PDE 解的_启动器-迭代器_神经算子 (SINO)。此外,还提出了正交正则化 (OrthoReg) 来通过防止组件之间的重叠来改进混合符号-神经模型,而其他工作则探索了现代神经网络架…
-
Triton MoE kernel 在 AMD 和 NVIDIA 上实现高性能
一个新实现的、完全用 Triton 编写的 Fused Mixture-of-Experts (MoE) dispatch kernel,其性能达到了 Stanford 的 Megablocks 库的 89-131%。该 kernel 尤其值得注意的是,无需任何代码修改即可在 AMD MI300X 硬件上运行。主要优化在于融合了 gate 和 projection 操作,通过将中间结果保留在寄存器中,显著减少了全局内存流量。
-
NyayAI推出印度法学AI法律助手
NyayAI是一个由AI驱动的法律情报平台,旨在让印度14亿公民能够便捷且经济地获取法律信息。该平台通过为律师和公民提供导航复杂法律文本的工具,解决了印度超过5000万起悬而未决的案件这一关键问题。与经常出现幻觉或缺乏法律深度的通用AI模型不同,NyayAI从头开始构建,拥有一个精选的印度法律文件语料库,提供精确检索、摘要和基于引用的答案。
-
ModeSwitch-LLM 提升单GPU LLM推理效率
研究人员开发了ModeSwitch-LLM,这是一种轻量级的控制器,旨在提高单个GPU上大型语言模型推理的效率。该系统根据工作负载特征,动态地将请求路由到各种推理模式,包括量化、推测和混合配置。在Meta-Llama-3.1-8B-Instruct上的评估表明,与标准的FP16相比,延迟速度提高了2.10倍,每token的能耗降低了51.7%,同时保持了近乎等效的准确性。
-
麻将强化学习模拟器 Mahjax 在 GPU 上达到每秒 200 万步
研究人员开发了 Mahjax,一个用于复杂日本麻将(Riichi Mahjong)游戏的新型 GPU 加速模拟器,该模拟器使用 JAX 实现。该工具旨在促进强化学习研究,特别是让代理从零开始学习,而不是依赖人类对局数据。Mahjax 实现了高吞吐量,在多块 GPU 上每秒可处理多达 200 万步,并已通过训练代理以提高其性能得到验证。