Neural Processing Units
PulseAugur coverage of Neural Processing Units — every cluster mentioning Neural Processing Units across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
综述详述面向消费电子的深度学习视频编码技术
本综述论文探讨了用于视频编码的基于深度学习的滤波(DLF)技术,重点关注其在消费电子产品中的应用。文章讨论了计算复杂度和功耗的挑战,这些挑战阻碍了DLF在UHD显示器和物联网小工具等设备上的部署。论文对DLF方法进行了分类,并分析了性能与硬件可行性之间的权衡,强调了向适用于神经网络处理单元(NPU)的轻量级架构的转变。文章还考虑了基于神经网络的视频编码(NNVC)的标准化工作,并指出了实时推理和错误传播等未来挑战。
-
AI-RAN工作负载已成功在NPU上运行,绕过了传统的基带芯片
研究人员已证明,通常用于AI推理的神经网络处理单元(NPU)可以有效地处理无线基带处理任务。通过重构通信算法以匹配NPU架构并优先考虑引擎利用率,他们使用Ascend 310B1边缘NPU和USRP X300实现了端到端的空中传输。这项工作首次肯定地回答了NPU是否能够支持AI-RAN工作负载,AI-RAN将AI和无线接入网功能统一起来。
-
新的Hawk框架通过硬件感知的AI增强NPU内核生成
研究人员开发了Hawk,一个旨在为神经网络处理单元(NPU)生成高性能内核的新型框架。与以往在硬件特定知识方面存在困难的方法不同,Hawk采用了一种无训练的方法,包含三个关键模块:运行时知识合成、瓶颈感知知识检索和效应驱动知识蒸馏。该系统旨在通过整合硬件感知知识来克服大型语言模型在NPU环境中的局限性,从而显著提高生成准确性和执行速度。
-
新的量化框架提升设备端 LLM 性能
研究人员开发了 Quant.npu,一个专为移动神经网络处理单元 (NPU) 上的大型语言模型 (LLM) 效率而设计的全静态量化新框架。该方法通过引入可学习的量化参数和旋转矩阵,解决了现有动态量化技术与 NPU 硬件不兼容的问题。Quant.npu 还引入了定制的初始化策略和两阶段优化流程,以确保稳定的训练并适应不同的激活分布,最终在保持与当前最先进方法相当的准确性的同时,将推理延迟降低高达 15.1%。