PulseAugur
实时 04:58:26
实体 Sram

Sram

PulseAugur coverage of Sram — every cluster mentioning Sram across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_210480 ·

    LLM 代理创建自适应硬件木马以测试检测器弱点

    研究人员开发了 TrojanGYM,一个利用多个大型语言模型创建自适应硬件木马的新颖框架。这些木马通过生成利用检测器盲点的多样化触发器和载荷,旨在绕过现有的基于学习的检测器。该框架包含一个涉及 LLM 代理、语法检查、功能验证和基于 GNN 的检测器的迭代循环,以改进木马插入策略。还引入了一个新的检测器 Robust-GNN4TJ,它显著提高了对 LLM 生成木马的检测率。

  2. RESEARCH · CL_196369 ·

    AMD收购Taalas,推动专用AI推理芯片

    AMD已收购加拿大AI推理芯片公司Taalas,将其专用硬件整合到AMD的加速器路线图中。Taalas专注于创建针对特定AI模型的优化芯片,旨在通过将模型权重硬编码到硬件中来降低推理成本并提高响应时间。这种方法牺牲了灵活性以换取效率,其首款芯片HC1专为Llama 3.1 8B设计,实现了高令牌生成速度。该策略的成功取决于所选模型是否具有足够且持续的使用量来证明定制成本的合理性,这是一个挑战,因为AI模型仍在快速发展。

  3. RESEARCH · CL_189459 ·

    AI模型被固化到硅片上以实现更快的推理,绕过内存瓶颈

    一种新趋势正在出现,即将AI模型直接固化到硅片上,这个过程将模型权重永久地嵌入为物理晶体管。这种方法,以Taalas等公司为代表,并由Groq先前探索过,旨在通过消除从外部内存移动权重的需求来显著提高推理速度。虽然GPU依赖高带宽内存(HBM),这是一个瓶颈且昂贵的组件,但固化硅片使用片上SRAM。这种转变可能会重新分配制造负荷并缓解HBM供应压力,尽管模型在硅片上固化的程度仍然是关键的设计变量。

  4. TOOL · CL_185577 ·

    SK Hynix、SanDisk 发布用于 AI 推理内存墙的高带宽闪存

    SK Hynix 和 SanDisk 合作开发了高带宽闪存 (HBF),这是一种旨在解决 AI 推理中内存墙挑战的新内存层。HBF 将大容量 NAND 闪存置于靠近各种 xPU(包括 GPU)的位置,以缓解数据移动造成的瓶颈。该规范在 Google 和 Tenstorrent 的参与下制定,定位在 HBM 和 SSD 之间,通过 Base Die 和主机软件管理模型权重、KV 缓存和代理工作负载等大型数据集。虽然 HBF 通过多通道并…

  5. TOOL · CL_181241 ·

    MCP、eMMC 和 eMCP:理解集成内存技术

    本文深入探讨了多芯片封装(MCP)、嵌入式多媒体卡(eMMC)和嵌入式多芯片封装(eMCP)技术之间的区别。MCP 是一种将 NAND 闪存、DRAM 或 SRAM 等多个芯片集成到单个单元中的封装方法,以减少 PCB 空间和设计复杂性。而 eMMC 是一个完整的嵌入式存储解决方案,在一个封装内结合了 NAND 闪存、控制器和 MMC 接口,符合 JEDEC 标准。

  6. RESEARCH · CL_178672 ·

    大疆孵化的电动自行车Amflow营收破10亿,挑战市场领导者

    Amflow,一家从大疆分拆出来的电动自行车公司,已实现超过10亿元人民币的营收,销售的高端电动山地自行车价格远高于市场普遍水平。该公司及其提供电助力系统的姐妹品牌Avinox,尽管面临电动自行车市场的经济挑战,仍成功进入欧洲市场。Avinox先进的系统提供卓越的扭矩和电池容量,并具备快充和OLED触摸屏等功能,帮助Amflow克服了行业传统限制,并在与Bosch和Shimano等老牌厂商的竞争中获得优势。

  7. RESEARCH · CL_164085 ·

    新型光学接收器通过光更新机器人AI,降低能耗

    研究人员开发了一种新颖的光学接收器,可以直接通过光来改变机器人的AI模型参数。该技术旨在通过光学传输数据来克服当前AI系统巨大的内存和能源需求,绕过产生瓶颈的传统电气连接。该系统使用类似QR码的光矩阵来修改内存单元,有可能降低数据中心和自动驾驶汽车等应用的功耗。

  8. TOOL · CL_160268 ·

    NumPy实现Flash Attention展示出显著的内存节省

    本文详细介绍了如何从零开始使用NumPy实现Flash Attention。Flash Attention通过避免物化占用大量内存的大型N×N注意力分数矩阵来优化Transformer模型。通过将计算分块并放入快速片上SRAM中,它极大地减少了内存使用量,在8192个token的序列长度下实现了8128倍的节省。

  9. TOOL · CL_158725 ·

    新型UEP编解码器将AI推理内存成本降低高达62.5%

    研究人员开发了一种新的AI推理内存保护方法,通过分析各种模型和浮点格式中的位位置故障敏感性。他们发现某些低位对性能影响很小,从而可以降低纠错开销。这一发现促成了一种不等错误保护(UEP)编解码器,可以在无需重新训练模型的情况下节省大量的存储和能源。

  10. TOOL · CL_154502 ·

    新的 ThRIve 方法提高了 PIM 架构中 CNN 推理的热鲁棒性

    研究人员开发了 ThRIve,一种新颖的训练方法,旨在提高卷积神经网络 (CNN) 在处理内存 (PIM) 架构上的推理热鲁棒性。该方法利用低秩自适应选择性地将参数存储在不易受热噪声影响的硬件上,从而在宽工作温度范围内保持一致的推理精度。与传统的基于 SRAM 的 PIM 系统相比,启用 ThRIve 的系统已显示出精度变化在理想无噪声性能的 2% 以内,并提供显著的能耗延迟乘积降低。

  11. TOOL · CL_152101 ·

    在具有片上SRAM的AI加速器上实现了3D高斯渲染器

    研究人员开发了首个专门用于智能处理单元(IPU)——一种AI加速器——的3D高斯渲染器实现。该系统利用1,472个具有片上SRAM的独立 tile,近似了高效传感器-处理器架构的约束。渲染器将高斯图元通过NEWS网格路由到目标 tile,并使用IPU的批量同步并行模型进行处理,从而实现核心之间的本地数据传输以利用空间和时间局部性。该研究分析了片间带宽和SRAM容量等瓶颈,对未来的无DRAM和片上传感器架构提出了启示,并可能为优化传统G…

  12. COMMENTARY · CL_121932 ·

    36氪:江铃汽车6月销量增长0.04%;北京君正DRAM价格上涨

    36氪报道,江铃汽车6月份销量为35,742辆,同比小幅增长0.04%。今年以来累计销量达189,000辆,同比增长9.46%。另外,北京君正指出,由于需求强劲和供应紧张,DRAM和部分SRAM芯片价格显著上涨,预计营收和利润率将持续增长。NOR Flash价格也有所上涨,但涨幅不及DRAM,强劲的销售也为营收增长做出了贡献。

  13. COMMENTARY · CL_121933 ·

    北京君正预测DRAM价格将因供应紧张而持续上涨

    北京君正预计,由于供应持续紧张,第三季度DRAM价格将进一步上涨,第四季度可能出现调整。该公司还指出,第二季度部分SRAM产品价格有所上涨,因为客户正在探索DRAM的替代品。虽然NOR Flash价格也有所上涨,但涨幅不如DRAM,且供应状况更为有利。

  14. TOOL · CL_123153 ·

    新框架增强了FPGA加速器中的容错能力

    研究人员开发了ProWAFT,一个专为SRAM基FPGA上实现的CNN加速器设计的新型容错框架。该系统解决了瞬态故障带来的挑战,这些故障可能损害边缘计算环境的可靠性。ProWAFT利用部分重构,跨可重构分区动态应用三模冗余(TMR),平衡工作负载关键性、故障传播和重构开销,以优化延迟、能耗和可靠性。

  15. TOOL · CL_118857 ·

    集群级内存的推出旨在解决AI芯片瓶颈

    集群级内存(CSM)的推出旨在解决AI芯片中的低延迟工作负载挑战。目前利用高带宽内存(HBM)的AI芯片由于内存子系统和互连瓶颈,在实现SRAM级解码速度方面面临限制。虽然纯SRAM芯片提供更快的速度,但它们会牺牲FLOPs密度和整体内存容量,导致吞吐量降低。

  16. RESEARCH · CL_113016 ·

    理想汽车目标通过自研AI芯片和模型实现特斯拉FSD V14同等水平

    理想汽车正在开发其自动驾驶能力,以匹配特斯拉的FSD V14,重点关注安全、效率和舒适性,以及识别特殊车辆和交通警察信号等高级功能。该公司正在整合视觉-语言-动作(VLA)和世界模型方法,强调语言模型在L3/L4自动驾驶中实现类人推理的关键作用。理想汽车还在大力投资自研AI基础设施,包括Mach M100芯片和强大的数据系统,目标是在其车辆内建立集中的AI计算中心,以提高效率和任务隔离性。

  17. TOOL · CL_112385 ·

    Flash Attention 机制详解:SRAM 中的分块注意力

    本文深入探讨了 Flash Attention 的机制,这是一种旨在优化 AI 模型中自注意力机制的技术。文章解释了分块注意力(一种将注意力计算处理成更小块的方法)如何适配 SRAM(静态随机存取存储器)架构。该解释旨在阐明使注意力机制更高效的底层过程。

  18. MEME · CL_111417 ·

    逻辑晶圆受限之际,SRAM供应矛盾遭质疑

    X上的一个对话突显了对SRAM供应的矛盾看法。对话质疑了SRAM的可用性,因为据报道用于其制造的逻辑晶圆供应受限。这表明半导体供应链中可能存在瓶颈或误解。

  19. RESEARCH · CL_110281 ·

    Qualcomm 发布近内存 AI 架构以提升性能

    Qualcomm 推出了名为 High Bandwidth Compute (HBC) 的新型近内存 AI 架构,旨在克服 AI 工作负载中的内存墙限制。该架构将 AI 加速器直接置于 LPDDR DRAM 堆栈下方,与传统的 High Bandwidth Memory (HBM) 和片上 SRAM 相比,提供了显著更高的每瓦带宽和容量。Qualcomm 的方法旨在降低高级封装的功耗、散热和成本,未来的 AI250 和 AI350 等…

  20. RESEARCH · CL_110439 ·

    Groq LPU 在 AI 推理领域崭露头角,挑战 GPU 主导地位

    Groq 的语言处理单元(LPU)正在 AI 推理市场获得关注,已超越小众应用,成为 AI 基础设施中公认的组成部分。这一转变是由日益增长的对专用硬件的需求所驱动的,以满足 AI 推理,特别是 Transformer 模型的多样化计算需求。虽然 Groq 的 LPU 在速度和效率方面具有潜在优势,尤其通过其高带宽 SRAM 和编译器技术,但其成本效益以及对混合专家(MoE)等动态模型架构的适应性仍存在疑问。与 NVIDIA 平台的集成…