实体
LLM Inference
LLM Inference
PulseAugur coverage of LLM Inference — every cluster mentioning LLM Inference across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
牛津大学研究人员详细介绍LLM推理新架构
牛津大学的研究人员详细介绍了一种专为大型语言模型(LLM)推理设计的新型混合HBM-HBF架构。这篇由《半导体工程》发表的技术论文概述了与半导体器件制造相关的架构进步。
-
Event Tensor 抽象统一了 LLM 的动态巨核编译
研究人员推出了一种新颖的编译器抽象 Event Tensor,旨在统一现代 GPU 工作负载的动态巨核编译。该抽象解决了当前巨核技术在处理大型语言模型 (LLM) 推理中常见的动态形状和数据依赖计算方面的局限性。Event Tensor Compiler (ETC) 利用此抽象生成高性能的持久核,展示了最先进的 LLM 服务延迟并降低了系统预热开销。