PulseAugur
实时 09:07:34
实体 UnfoldML

UnfoldML

PulseAugur coverage of UnfoldML — every cluster mentioning UnfoldML across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_69719 ·

    UnfoldML 集成 RadixAttention 以提高 LLM 效率

    UnfoldML 推出了 RadixAttention,这是一种提高大型语言模型效率的新方法。该技术旨在降低与注意力机制相关的计算成本,而注意力机制是 LLM 的核心组成部分。RadixAttention 已集成到 Trellis 框架中,旨在使 LLM 的开发和部署更易于访问且性能更高。

  2. TOOL · CL_68779 ·

    UnfoldML 使用 RadixAttention KV 缓存优化 LLM 推理

    UnfoldML 推出了 RadixAttention,这是一种新的 KV 缓存策略,旨在优化 LLM 推理的预填充阶段。该方法利用基数树数据结构来高效地存储和共享多个并发推理请求之间的共同前缀,从而减少内存使用和计算量。该系统专为用户在本地硬件上部署 LLM 推理而设计,优先考虑数据隐私并适应不同的硬件能力。