实体
Queries
Queries
PulseAugur coverage of Queries — every cluster mentioning Queries across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的 RotateAttention 框架加速了 AI 视频生成
研究人员开发了 RotateAttention,一个新颖的混合精度 INT4 FlashAttention 框架,旨在加速使用 3D 旋转位置嵌入 (3D RoPE) 的基于 DiT 的视频生成模型。该框架解决了在线旋转矩阵与 RoPE 协调的挑战,并优化了注意力矩阵 P 的量化。实验表明,RotateAttention 在保持与全精度模型相当的视频生成质量的同时,实现了显著的加速。
-
新的PORTS方法提高了LLM工具选择的准确性
研究人员开发了PORTS,一种用于训练检索器以更好地为大语言模型(LLM)选择工具的新方法。现有的检索器由于训练过程分离,常常与LLM不匹配。PORTS使用带有冻结LLM的偏好优化技术来微调检索器,通过将选择概率与下游性能相关联来提高其查找有用工具的能力。这种方法在各种数据集和LLM上都显著提高了工具选择的准确性,计算需求低,并且具有良好的泛化能力,适用于实际应用。
-
无键注意力机制将KV缓存减半,提高Transformer效率
研究人员推出了一种新颖的Transformer注意力机制——无键注意力(Keyless Attention),该机制完全消除了键投影,仅基于查询(queries)和值(values)进行操作。与标准注意力相比,这种方法产生了一个仅值缓存(Value-Only Cache),将KV缓存内存和访问开销减半,同时保持或提高了解码吞吐量。该机制还实现了深度注意力因子分解(Depth-m Attention Factorization),实验表…