DLRM
PulseAugur coverage of DLRM — every cluster mentioning DLRM across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
LinkedIn的TransX架构将推荐CTR提升6% · arXiv研究
研究人员开发了TransX,一种新颖的推荐系统编码器-解码器架构,解决了整合长期用户行为与实时服务事件的挑战。该方法将这些不同数据流的建模解耦,并使用交叉注意力实现更高效的解码。TransX专为低延迟、高吞吐量部署而设计,采用摊销服务策略,使服务延迟与行为序列长度无关。在LinkedIn推荐系统上的在线A/B测试表明,TransX显著提高了点击率6.0%和转化率4.4%,同时保持了可比的服务成本,并将在线计算量减少了约80%。
-
新指标量化AI模型对硬件故障的脆弱性
研究人员开发了一种名为参数脆弱性因子(PVF)的新指标,用于量化AI模型对硬件故障(特别是静默数据损坏,SDC)的易感性。该指标旨在标准化评估参数损坏如何影响AI模型输出。PVF指标已应用于各种任务和模型,包括推荐系统(DLRM)、视觉分类(CNN)和文本分类(BERT),并对DLRM进行了详细分析。值得注意的是,PVF为Meta内部AI芯片MTIA的关键错误管理设计决策提供了信息。
-
新的无损压缩技术加速机器学习训练和推理
研究人员开发了一种名为不变位打包 (IBP) 的新无损压缩算法,以解决机器学习中的 GPU 内存限制。IBP 识别并移除张量组中的冗余位,从而实现更快的数据传输并减少瓶颈。该方法已显示出显著的加速效果,包括 GNN 训练速度提高 74%,LLM 推理速度提高 24%,且不损失准确性。
-
新的基于机器学习的GPU缓存算法LCR提升LLM推理速度
研究人员开发了一种名为学习增强LRU (LALRU) 的新GPU缓存算法,旨在提高AI推理期间的效率。该算法将学习到的预测与缓存策略相结合,以确保在预测准确时接近最优,并在预测不准确时限制性能下降。基于LALRU的一个实际实现LCR,在LLM工作负载中表现出显著的改进,将P99首个令牌时间缩短了高达28.3%,并将DLRM工作负载的吞吐量提高了高达24.2%。