field-programmable gate array
PulseAugur coverage of field-programmable gate array — every cluster mentioning field-programmable gate array across labs, papers, and developer communities, ranked by signal.
- used by hls4ml 80%
- developed by hls4ml 70%
- developed Spiking neural networks 70%
- developed by CNN 70%
- used by CNN 70%
- instance of CNN 70%
- used by Spiking neural networks 70%
- used by central processing unit 70%
- used by Large Hadron Collider 70%
- developed hls4ml 70%
- used by application-specific integrated circuit 70%
- instance of application-specific integrated circuit 70%
13 天有情绪数据
-
面向能效的FPGA图卷积网络(GCN)加速器协同优化稀疏化与近似计算
研究人员开发了一种新颖的、面向边缘设备能效推理的图卷积网络(GCN)FPGA加速器。该系统在AMD Kria KV260平台上集成了图稀疏化与近似计算技术,特别是8位量化和近似乘法器。在Cora和Amazon Photo等数据集上的评估显示,在保持高分类精度的同时,功耗低于1W,速度提升高达9.88倍。研究强调,图稀疏化与近似算术的协同优化是实现高效低功耗GCN推理的关键。
-
新的Cocoon架构提高了差分隐私机器学习训练的效率
研究人员开发了Cocoon,一种旨在提高差分隐私机器学习训练效率的新系统架构。该方法通过利用相互抵消的相关噪声,解决了差分隐私通常伴随的准确性下降问题。Cocoon优化了跨CPU、GPU和专用近存储器处理(NMP)设备的大噪声历史记录处理,并包含针对稀疏嵌入表的特定优化。在基于FPGA的NMP原型上进行的测试表明,性能提升了1.23倍至10.82倍。
-
Qwen 3.5 LLM 使用 eBay 挖矿硬件在 FPGA 上实现
一位用户使用 INT4 量化技术,在现场可编程门阵列 (FPGA) 上实现了 Qwen 3.5 大型语言模型。该项目利用相对廉价的 eBay 挖矿硬件,特别是 SQRL FK33 和 Jungle Cat 板卡,来实现 LLM 推理。对 Qwen 3.5 9B 模型的初步测试表明,在 75MHz 下的推理速度约为 2 tokens/秒,并预计 27B 模型在多卡设置和优化 RTL 下将实现显著更高的性能。
-
脉冲神经网络增强实时量子比特读出
研究人员开发了一种使用脉冲神经网络(SNN)的新方法,用于在量子处理器中更快、更准确地分配量子比特状态。这些SNN实时处理测量数据,在获取读出信号时提供不断变化的分类分数。这种流式处理能力优于传统的匹配滤波技术,并且在准确性上接近全轨迹人工神经网络,有潜力在FPGA硬件上实现低延迟、实时的量子比特读出。
-
神经形态PRNGs实现低功耗和高质量
研究人员开发了一种新颖的神经形态伪随机数生成器(NPRNG),它利用大脑高效生成不可预测序列的能力。这种新的NPRNG基于平衡脉冲神经网络模型,使用泄漏积分发放神经元,专为低功耗硬件实现而设计。在FPGA上实现的原型,在消耗仅3.24 mW的同时,以120kbps的速度展示了高质量的随机数生成。
-
MeshKV 架构通过新颖的 NoC KV 缓存结构提升 Transformer 解码性能
研究人员开发了 MeshKV,这是一种新颖的片上网络(NoC)架构,旨在通过优化键值(KV)缓存的移动来加速 Transformer 解码。该系统将 KV 缓存块视为分组流,从而减少了流量并提高了带宽利用率,解决了传统分块加速器中的瓶颈问题。MeshKV 已在 FPGA 实现中展示了显著的性能提升,包括互连流量减少高达 58%,以及在使用 LLaMA-2 7B 和 Mistral-7B 等模型的多流吞吐量增加 1.9 倍。
-
FPGA平台加速用于DNN的近似乘法器评估
研究人员开发了FAME,一个利用FPGA加速深度神经网络近似乘法器评估的新平台。这种基于硬件的方法显著减少了评估乘法器设计及其对DNN推理精度的影响所需的时间,其性能比传统的基于LUT的仿真方法高出3.47倍。此外,该平台还包含一种模式引导的再训练技术,与现有的再训练方法相比,可以恢复高达65.5%的精度损失。
-
WARD 框架通过自适应可靠性增强边缘 AI 视觉 Transformer
研究人员开发了 WARD,一个旨在增强边缘 AI 应用中使用的视觉 Transformer 可靠性的新框架。WARD 通过采用通道级子网络划分和可靠性感知持续学习,解决了动态功耗预算、不断变化的可靠性需求和波动的输入分布的挑战。该框架支持四种不同的运行模式,允许计算成本和可靠性进行动态调整,以确保不间断的推理,即使在高错误率下也是如此。WARD 在 FPGA 加速器上实现,展示了最小的硬件开销和快速的模式转换能力,使其适用于实时边缘 AI 部署。
-
新框架优化AI模型压缩以用于FPGA部署
研究人员开发了FairCompressAgent (FCA),一个旨在优化模型压缩以部署在现场可编程门阵列 (FPGA) 上的新框架。FCA集成了剪枝、量化和分解等各种压缩技术,由一个语言模型规划器管理,该规划器根据用户对准确性、公平性和部署成本的要求来选择配置。实验表明,FCA可以显著减小存储空间,同时提高准确性和公平性指标,在效率方面优于其他搜索方法。
-
FPGA加速的广度学习框架改进了电动汽车充电的谐波分析
研究人员开发了一个高效广度学习(EBL)框架,旨在加速电网的谐波分析,特别是用于管理电动汽车引起的失真。这种FPGA加速的方法以最少的数据输入实现了高精度,预测速度远超现有的FPGA方法。EBL框架通过在线迁移学习展示了快速适应性,并能高效利用FPGA资源,与最先进的估计器相比消耗更少的查找表(LUT)。
-
SkyEgg 框架通过代数规则优化 FPGA 硬件综合
研究人员开发了 SkyEgg,一个旨在更好地利用现代现场可编程门阵列 (FPGA) 异构性的新硬件综合框架。与先前顺序处理资源的框架不同,SkyEgg 将代数重写规则与目标特定的硬件映射和配置相结合。这种方法允许更全面地探索实现选择,从而能够联合优化等价形式、资源映射和调度以最小化延迟。在评估中,SkyEgg 相较于 Vitis HLS 和 Altera HLS 分别实现了平均 3.12 倍和 3.18 倍的显著加速。
-
Syn2Logic框架自动化神经形态硬件设计
研究人员开发了Syn2Logic,一个用于端到端神经形态设计自动化(eNDA)的新型框架。该系统允许神经科学家使用自定义的领域特定语言对神经行为进行建模,然后将其编译成可综合的RTL硬件,无需手动编写硬件描述语言。该框架在模拟秀丽隐杆线虫、解决数独谜题、MNIST数据集上的图像识别以及OPS-SAT上的无监督学习等任务的加速器方面,展示了显著的性能提升。
-
新的OASIS框架大幅降低片上视觉数据传输成本
研究人员开发了OASIS,一种新颖的分布式片上视觉框架,通过在图像传感器附近处理信息,显著降低了数据传输成本。该系统采用轻量级编码器创建紧凑、与任务相关的表示,从而实现大幅通信缩减。OASIS支持两种部署路径:一种使用4位量化和霍夫曼编码,另一种利用超维度计算进行分类。OASIS在FPGA上实现,并计划用于ASIC,在保持各项视觉任务竞争力的准确性的同时,展示了系统总能量降低2倍至4.5倍。
-
受生物启发的神经网络在忆阻器硬件上运行
研究人员开发了一种受啮齿动物CA3海马亚区域启发的全新脉冲神经网络,并在忆阻器硬件上展示了其功能。该网络融入了神经元多样性和真实的静息态动力学,以显著减少的神经元和突触数量实现了与更大规模网络相似的行为。在利用忆阻器噪声的FPGA/忆阻器平台上实现该网络,其性能优于模拟,凸显了受生物启发的算法在新兴的神经形态计算硬件上的潜力。
-
新的BiHDTrans模型融合超维度计算与Transformer,实现高效时间序列分类
研究人员开发了BiHDTrans,这是一种新颖的神经符号二值超维度Transformer,专为高效多元时间序列分类而设计,特别适用于资源受限的边缘环境。该模型集成了自注意力机制与超维度计算原理,将HD计算的表示效率与Transformer的时序建模能力相结合。BiHDTrans在准确性和推理延迟方面均优于现有的最先进的HD计算模型和二值Transformer,尤其是在FPGA上加速时。该方法还对降维具有弹性,在模型尺寸减小和延迟降低的…
-
新方法直接在FPGA上训练神经网络
研究人员开发了DiffLUT-Net,一种在现场可编程门阵列(FPGA)上直接训练神经网络的新方法。该方法能够从头开始学习查找表(LUT)的真值表条目和网络的连接性。然后,训练好的网络可以导出为可综合的Verilog代码,在各种基准测试中提供具有竞争力的精度-资源权衡,实现高效的FPGA原生推理。
-
FPGA模拟器核心为世嘉的VR赛车实现99%的速度
已为现场可编程门阵列(FPGA)开发了一个新的模拟器核心,该核心能够精确复制世嘉模型1硬件,使VR赛车游戏能够以接近原始速度99%的速度运行。这一发展标志着通过模拟来保存和体验经典街机硬件迈出了重要一步。
-
新的 T-KAN 架构提升高频交易预测能力
研究人员推出了一种新颖的架构——时间柯尔莫哥洛夫-阿诺德网络 (T-KAN),旨在改进高频交易 (HFT) 预测。与难以处理嘈杂、非线性限价订单簿数据和 Alpha 衰减的传统模型不同,T-KAN 利用可学习的 B 样条激活函数来捕捉信号形状而非仅是幅度。该方法在 k=100 的预测范围内,F1 分数相对提高了 19.1%,并实现了 132.48% 的回报,而 DeepLOB 则出现了显著回撤。T-KAN 模型还提供了增强的可解释性,…
-
SymbolicLight V2 在语言推理方面实现了 27.6% 的能耗降低
研究人员开发了 SymbolicLight V2,这是一种专为低能耗语言推理设计的混合神经形态架构。该更新模型通过引入分级符号事件和新颖的局部注意力机制,增强了其前身 SymbolicLight V1。在 Alveo U50C FPGA 上的实现证明了每生成一个 token 的能耗显著降低,降低了 27.6%。此外,在 ARM CPU 上运行时,与 GPU 基线相比,该系统显示出可观的节能效果,突显了事件稀疏性在减少计算和数据移动方面的优势。
-
对AI友好的电机优先考虑良好的AI控制接口设计
电机“对AI友好”的定义正在被重新定义,以强调有利于人类程序员和AI模型的工程特性。关键属性包括意图级命令而非低级时序、清晰结构化的文档、可靠的位置和状态反馈机制,以及内置的硬件安全功能。这些特性对于AI代理通过工具调用或代理循环可靠地控制物理设备至关重要,它们本质上是良好的接口设计原则,同时也提高了人类操作员的可用性。