PulseAugur
实时 08:15:52
实体 field-programmable gate array

field-programmable gate array

PulseAugur coverage of field-programmable gate array — every cluster mentioning field-programmable gate array across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 58
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 48
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 58 条
  1. TOOL · CL_215363 ·

    Analogue 3D 将 N64 游戏提升至 4K 以适配现代电视

    Analogue 3D 游戏机提供了一种在现代 4K 电视上玩原版 Nintendo 64 卡带的方式,尽管它并非以原生 4K 分辨率渲染游戏。相反,它将 N64 游戏的低分辨率输出提升至 4K HDMI 信号,同时还提高了清晰度、色彩和帧率。该设备利用现场可编程门阵列 (FPGA) 来忠实地复制 N64 的原始硬件行为,提供比标准模拟或直接连接到现代电视更精美的视觉体验。

  2. TOOL · CL_198254 ·

    新的FQTree算法优化增强决策树以进行硬件部署

    研究人员开发了FQTree,一种用于增强决策树(BDTs)的细粒度感知量化训练的新型算法。该方法与用于自动硬件生成的QXGB框架相结合,能够更有效地在延迟敏感型应用中部署BDTs。与现有的基于FPGA的BDTs设计相比,FQTree的面向硬件的叶值量化方案将LUT使用量减少了26-57%,同时在JSC、MNIST和NID等基准测试中保持或提高了准确性。

  3. TOOL · CL_198227 ·

    SAR数据压缩与去噪框架部署在FPGA上

    研究人员已成功将联合合成孔径雷达(SAR)去噪与数据压缩框架部署到嵌入式FPGA平台。这项工作解决了未来SAR任务中对板载数据缩减的关键需求,以实现近乎实时的地球观测。该研究调整了模型拓扑以满足星载系统的约束,并评估了在不同精度和平台(包括CPU、GPU和FPGA)上的性能。主要发现表明,ReLU激活函数比用于自然图像的激活函数更适合SAR图像,并且FPGA为这项任务提供了最高效的解决方案。

  4. TOOL · CL_202781 ·

    FQTree算法实现增强决策树的高效硬件部署

    研究人员开发了FQTree,一种用于增强决策树(BDTs)的细粒度感知量化训练的新型算法。该方法与用于自动硬件生成的QXGB框架相结合,解决了在延迟敏感应用中高效部署BDTs的挑战。FQTree采用面向硬件的叶值量化方案,可降低硬件成本并保持或提高准确性,与现有设计相比,在FPGA上显著减少了LUT使用量。

  5. RESEARCH · CL_191187 ·

    HLSmith 框架通过专家指导提升 C/C++ 到 HLS 的翻译效率 · 跟踪 2 个来源

    研究人员开发了 HLSmith,一个旨在通过高层次综合 (HLS) 改进 C/C++ 代码到高性能硬件加速器翻译的框架。该系统包含一个编码硬件优化技术的专业知识库、一个模拟专家实践的指导编排流程,以及一个用于适应前沿模型的管道。HLSmith 在基准测试中显著优于之前的代理编排框架(如 ChatHLS),实现了 4.24 倍的几何平均加速比和 100% 的有效设计率,而 ChatHLS 的有效设计率为 57%。

  6. TOOL · CL_180748 ·

    CascadeLUT 优化FPGA神经网络推理以应对带宽限制

    研究人员开发了CascadeLUT,一个用于在带宽受限条件下优化现场可编程门阵列(FPGA)上神经网络推理的新颖框架。该方法将特征划分为有序子集,允许在数据到达时逐步细化预测,从而减少数据移动并提高吞吐量。与现有的基于查找表(LUT)的方法相比,CascadeLUT在延迟、吞吐量和能耗方面均有显著改善,同时还集成了片上输入量化以获得进一步的效率提升。

  7. TOOL · CL_178506 ·

    New hls4ml backend enables ML on radiation-hard FPGAs for physics experiments

    研究人员为hls4ml工具开发了一个新的后端,使得在抗辐射FPGA上使用机器学习模型成为可能。这一进展通过一个为LHCb Upgrade II实验中的PicoCal量热计设计的轻量级自编码器得到证明。该系统实现了25纳秒的延迟,并仅使用了最少的FPGA资源,为高辐射环境中的ML应用铺平了道路。

  8. RESEARCH · CL_178363 ·

    揭示新的KAN压缩和二值KAN恢复技术

    研究人员开发了SparseKAN,一种通过减少基函数、神经元和数值精度来压缩Kolmogorov-Arnold网络(KANs)的方法。该方法旨在通过移除冗余参数而不牺牲准确性来提高KANs的效率,在软件和硬件性能方面均有显著改进。另外,另一篇研究论文介绍了BiKAN,该方法通过使用Walsh字符恢复二值KANs中的基函数来解决二值KANs的崩溃问题,从而在各种基准测试中提高了准确性和硬件效率。

  9. TOOL · CL_167318 ·

    为FPGA上的实时异常检测优化Transformer神经网络

    研究人员开发了一种方法,用于优化Transformer神经网络在金融时间序列数据中进行实时异常检测。该方法利用现场可编程门阵列(FPGA)的能力来提高处理速度并最小化延迟。该研究探讨了各种Transformer架构及其在FPGA板上的高效实现,旨在提高日益增长的金融数据集的数据清理方法的准确性和速度。

  10. TOOL · CL_164018 ·

    FPGA在3D打印模型中重构F-14“雄猫”战斗机的‘第一款微处理器’

    一款FPGA重构的、来自格鲁门F-14“雄猫”战斗机的中央空气数据计算机(CADC)已在3D打印的比例模型中开发并展示。此次重构聚焦于MP944芯片,一些专家认为它是世界上第一款微处理器,比Intel 4004更早。该项目提供了所有六个原始CADC芯片的开源VHDL代码,以便进一步研究和开发。

  11. MEME · CL_157175 ·

    开发者否认Midway Wolf Unit FPGA核心涉及AI

    一位开发者否认了关于其为Midway的Wolf Unit街机板开发的FPGA核心工作涉及人工智能的说法。该开发者,化名blahm1d,表示这一说法完全是捏造。此前,MiSTer FPGA核心发布,许多人认为这是一项不可能完成的任务。

  12. TOOL · CL_156313 ·

    新型E-SpecFormer模型为物联网提供高效射频频谱监测

    研究人员开发了E-SpecFormer,这是一种专为边缘设备上高效射频频谱监测设计的新型Transformer模型。该模型包含一种名为LiTAN的新颖注意力机制,可降低计算复杂度并提高准确性。E-SpecFormer有四个变体,其中Nano版本使用最少的参数和处理时间,在调制识别和隐蔽信道检测任务上实现了高精度,使其适用于物联网应用的实时频谱情报。

  13. RESEARCH · CL_147740 ·

    新型FPGA架构提升机器学习推理效率

    研究人员开发了一种名为NIFA的新型FPGA架构,可提高深度学习推理效率。该架构集成了使用模拟内容可寻址内存(ACAM)的无ADC片上计算(IMC)模块,以原生执行非线性运算。NIFA系统优化了FPGA的交叉开关尺寸,并利用ACAM进行动态矩阵-矩阵乘法,将IMC的应用范围扩展到Transformer模型中的注意力计算。这种方法显著提高了CNN和基于Transformer的工作负载的能效和面积效率。

  14. RESEARCH · CL_141196 ·

    机器学习增强高能物理硅传感器数据重建

    研究人员开发了机器学习技术,以改进高能物理中使用的阻性硅传感器的全波形数据重建和压缩。该研究探讨了循环神经网络(特别是LSTM层)用于全波形重建,并考虑了其在现场可编程门阵列(FPGA)上的部署。此外,该工作还研究了基于Transformer的拓扑无关架构,旨在保持高位置分辨率并指导未来的传感器设计。

  15. TOOL · CL_139785 ·

    北京大学通过光学芯片突破实现AI速度提升百倍

    北京大学的研究人员开发了一种新颖的全光互连系统,显著提高了AI处理速度。这项突破利用光信号连接标准电子芯片,实现了AI速度提升百倍,同时仅消耗通常所需计算功耗的一小部分。该系统在《国家科学评论》上进行了详细介绍,采用了定制设计的硬件组件,包括硅光收发器,以促进电信号和光信号之间的转换。

  16. TOOL · CL_133650 ·

    新的剪枝技术优化了嵌入式事件驱动视觉的GCN

    研究人员开发了一种面向嵌入式事件驱动视觉系统的图卷积神经网络(GCN)的硬件感知剪枝和量化策略。该方法旨在通过减少内存使用同时保持推理精度来优化资源受限FPGA平台上的GCN模型。在CIFAR-10、MNIST-DVS和N-Caltech101等数据集上的评估表明,BRAM内存显著减少,精度下降幅度在1.65%至5.18%之间。

  17. TOOL · CL_131569 ·

    BitLogic框架统一了FPGA原生神经网络的训练

    研究人员开发了BitLogic,一个统一的框架,旨在标准化利用布尔逻辑运算而非传统乘加运算的梯度下降型神经网络的训练和评估。该框架允许将单个训练好的检查点部署到GPU、FPGA和ASIC上,解决了当前训练流水线和硬件报告惯例的碎片化问题。通过系统地分析设计空间,BitLogic识别出一种最优配置,在准确性和效率方面均优于以往的方法,在FPGA上实现了比GPU显著更高的吞吐量和更低的能耗。

  18. TOOL · CL_131555 ·

    DBNN 为脑机接口实现准确、低功耗的神经脉冲分类

    研究人员开发了一种深度二值化神经网络(DBNN),用于可植入脑机接口的节点内脉冲分类。该 DBNN 系统具有两个二值化隐藏层,通过符号控制累加和按位逻辑实现无乘法器推理。所提出的分类器在合成和体内数据集上实现了 98.7% 的中位数准确率,其 FPGA 原型展示了低延迟和低硬件成本。ASIC 可行性研究表明其硅面积小且工作功耗极低,适合低功耗、可植入的神经接口。

  19. TOOL · CL_128844 ·

    面向FPGA的新型Transformer架构实现高压缩率

    研究人员开发了ELiTeFormer,这是一种新颖的Transformer模型架构,专门为在现场可编程门阵列(FPGA)上高效部署而设计。该架构统一了混合线性注意力与超低精度三元线性投影,实现了显著的模型权重和KV缓存压缩。与部署在硬件上的现有模型(如LLaMA 3)相比,ELiTeFormer在准确性方面具有竞争力,并在延迟和能效方面提供了实质性改进。

  20. TOOL · CL_128742 ·

    新研究实现了服务器的细粒度计算卸载

    一篇新研究论文提出了一种在服务器中实现细粒度计算卸载的方法,旨在通过将卸载与其他请求重叠来提高性能。该方法利用服务器现有的并发机制,将卸载视为一个路由问题,而无需进行完全重写。该技术涉及将卸载提交给执行器,挂起请求,并在完成后恢复请求,这在各种服务器并发模型下,在真实硬件上显示出1.2-5.4倍的性能提升。