PulseAugur
实时 15:07:06
实体 Processing in memory

Processing in memory

PulseAugur coverage of Processing in memory — every cluster mentioning Processing in memory across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_165067 ·

    新的RED-PIM技术通过内存内处理大幅降低Transformer延迟

    研究人员开发了RED-PIM,这是一种旨在提高Transformer模型效率的新型算法-架构协同设计。该方法通过在内存内部执行计算(一种称为内存内处理(PIM)的技术)来解决Transformer中显著的数据移动瓶颈。RED-PIM专门针对注意力操作,减少了银行间数据移动,并缩小了中间矩阵,以最小化延迟和计算成本。该系统在较长序列上实现了高达99.99%的推理时间缩减,并在保持准确性的同时,在真实数据集上实现了显著的性能提升。

  2. TOOL · CL_154502 ·

    新的 ThRIve 方法提高了 PIM 架构中 CNN 推理的热鲁棒性

    研究人员开发了 ThRIve,一种新颖的训练方法,旨在提高卷积神经网络 (CNN) 在处理内存 (PIM) 架构上的推理热鲁棒性。该方法利用低秩自适应选择性地将参数存储在不易受热噪声影响的硬件上,从而在宽工作温度范围内保持一致的推理精度。与传统的基于 SRAM 的 PIM 系统相比,启用 ThRIve 的系统已显示出精度变化在理想无噪声性能的 2% 以内,并提供显著的能耗延迟乘积降低。

  3. TOOL · CL_48989 ·

    新编译器DCC优化内存处理架构上的机器学习内核

    研究人员开发了DCC,这是一种新颖的以数据为中心的编译器,旨在优化内存处理(PIM)架构上的机器学习内核。该编译器通过联合优化数据重排和计算代码优化这两个相互依赖的过程来应对挑战。DCC通过多层抽象支持多个PIM后端,并已展示出显著的加速效果,与仅使用GPU相比,在HBM-PIM上实现了高达7.68倍的加速,在AttAcc PIM上实现了13.17倍的加速。对于端到端的LLM推理,AttAcc上的DCC将GPT-3和LLaMA-2的平…