Alibi
PulseAugur coverage of Alibi — every cluster mentioning Alibi across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
Transformer注意力机制中位置编码技术的映射
本文探讨了Transformer架构中的位置编码技术,重点关注位置信息如何以及在何处被整合到注意力机制中。文章超越了按时间顺序的呈现方式,而是根据方法在注意力公式中的注入点进行分类。作者提出了一个2x2的网格(绝对与相对,固定与学习)来映射这些技术,并将其与原始Transformer在注意力层之前将位置向量添加到token嵌入中的方法进行了对比。
-
ALiBi位置编码减少了视觉Transformer中的偏差
研究人员已经识别并解决了视觉Transformer(ViTs)中的位置偏差问题,特别是在DINOv2等模型中。这些偏差源于位置编码等架构选择,可能会阻碍在没有固有方向线索的图像任务上的零样本适应。研究表明,通过微调ViTs使用ALiBi相对位置编码,可以显著减少这些偏差,同时保留通用的语义理解。由此产生的无偏差特征在复杂显微镜图像的可训练分割中取得了成功。
-
新研究增强 Transformer 位置编码以更好地理解语言
两篇新研究论文探讨了 Transformer 模型位置编码的进展,旨在提高它们对 token 顺序和句法结构的理解。第一篇论文全面 survey 了现有方法,从绝对和相对嵌入到旋转位置嵌入 (RoPE) 及其长上下文扩展,强调了通过各种任务评估上下文扩展的重要性。第二篇论文引入了语法感知位置嵌入 (SiPE),它将依赖解析的句法信息集成到位置嵌入中,在不增加推理成本的情况下,在 SyntaxGym 和 GLUE 等基准测试中显著提高了…
-
ALiBi 位置编码数值失败在 AI 模型中被识别
研究人员在 ALiBi 位置编码中发现了一个重大的数值失败问题,ALiBi 是许多最先进的预训练模型中使用的组件。ALiBi 中的线性偏置缩放会导致浮点精度下溢,使得相当一部分注意力权重变为零,导致注意力头部分失明。这个问题主要影响令牌检索任务,例如密码检索,而对标准的解码器基准测试影响较小。该研究提出并评估了四种缓解策略,其中对数缩放距离在密码检索方面显示出最一致的改进,尽管默认的 ALiBi 斜率在“针尖寻踪”检索方面仍然是一个强大的基线。
-
对抗性评论绕过LLM代码漏洞检测器
研究人员开发了ALIBI,一个新颖的攻击框架,通过在源代码中插入对抗性自然语言注释来绕过基于LLM的漏洞检测器。该技术通过引导其推理或模仿工具输出来成功操纵了90%以上的受测检测器,包括先进的多代理系统。该攻击利用了LLM对注释作为上下文的信任,这是一种类似于聊天界面中提示注入的漏洞,并突显了当前静态分析工具的不足。
-
研究:位置编码方案塑造 Transformer 注意力头代数
一篇新的研究论文探讨了 Transformer 模型中的位置编码方案如何影响注意力头的谱代数。研究发现,不同的位置编码方案,如旋转位置嵌入(RoPE)、学习绝对位置编码和 ALiBi,会导致注意力头产生不同的谱指纹。这些指纹并非预先设定的约束,而是在训练过程中动态产生的,反映了注意力头的功能作用。研究表明,位置编码方案的选择显著影响模型的学习过程和效率。
-
累积变换可改善LLM长度外推能力,但在极端情况下会下降
研究人员调查了累积变换在注意力机制中的外推能力,特别研究了用累积的、依赖数据的Householder反射替换RoPE的位置索引旋转如何影响性能。他们的发现表明,虽然这些累积变换可以改善长度外推能力,但在极端上下文长度下性能最终会下降。该研究还探讨了一种使用累积的、依赖令牌的旋转的简化变体,该变体表现出类似的行为。理论分析表明,累积的正交变换在有限步数后会导致不连贯,限制了对远距离令牌的注意力,并创建了一个有限的混合窗口。
-
xFormers 库可在 GPU 上实现内存高效的 Transformer 模型
本教程演示了如何使用 xFormers 库在 GPU 上构建内存高效的 Transformer 模型。它涵盖了实现和比较内存高效注意力与标准注意力,分析了因果掩码、打包序列、分组查询注意力 (GQA) 和 ALiBi 位置偏差等技术。该指南还展示了如何将这些方法结合到一个可训练的 GPT 风格模型中,该模型利用 xFormers 注意力和 SwiGLU 前馈层进行自动混合精度训练。
-
Jordan-RoPE: 通过复数约旦块实现的非半单相对位置编码
研究人员引入了 Jordan-RoPE,一种利用复数约旦块的 Transformer 模型新型相对位置编码方法。该方法生成振荡-多项式特征,实现了与 RoPE 和 ALiBi 等现有方法不同的距离调制相位基。虽然缩放精确变体在 WikiText-103 语言模型上比基线有所改进,但 RoPE+ALiBi 总体上仍然表现最强,表明 Jordan-RoPE 对特定任务具有结构优势。
-
Eugene Yan 分享举办每周 AI 论文俱乐部以建立学习社区的指南
Eugene Yan 详细介绍了其成功的每周论文俱乐部,该俱乐部已运行 18 个月,讨论了至少 80 篇与 AI 相关的论文。俱乐部专注于机器学习中的基础概念、模型、训练和推理技术。Yan 为他人建立类似的学习社区提供了实用指南,强调了持续的日程安排、预读和引导式讨论,以促进技术理解和建立专业人脉。