PulseAugur
实时 05:36:14
实体 steering vectors

steering vectors

PulseAugur coverage of steering vectors — every cluster mentioning steering vectors across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_218882 ·

    New 'Semantic Overlays' Technique Enhances LLM Security Against Prompt Injection

    Researchers have developed a new technique called Semantic Overlays to combat prompt injection attacks in language models. This method introduces a non-textual channel to the model's input, allowing it to understand the…

  2. TOOL · CL_193698 ·

    新方法降低了LLM转向向量的安全风险

    研究人员开发了一种方法来减轻与大型语言模型中的转向向量相关的安全风险。这些用于控制模型行为的向量可能会无意中削弱安全机制,并增加对有害请求的响应。新技术识别并移除了转向向量中导致这种安全退化的特定组件,在对预期转向能力影响最小的情况下恢复模型的安全性。这种方法为转向向量提供了事后修正,并为在不损害安全性的情况下应用模型干预提供了一种通用策略。

  3. TOOL · CL_183320 ·

    新研究揭示了大型语言模型中的“反向”转向向量

    研究人员在转向向量(SVs)中发现了一种“反向检测-控制现象”,SVs是一种用于影响大型语言模型输出的技术。当具有高度辨别力的SV,本意是促进特定概念时,实际上会导致模型表现出相反的行为。该研究提出了一种在无需生成响应的情况下区分这些“反向转向向量”(ISVs)的方法,从而能够进行有针对性的符号翻转以改进转向流程。该方法在不同模型和概念的30项实验中的27项中均显示出改进。

  4. RESEARCH · CL_112642 ·

    AI对齐研究通过新技术解决奖励函数被滥用问题

    研究人员正在探索防止AI模型利用奖励函数(即奖励函数被滥用)的各种方法。一种方法是使用转向向量来指导梯度路由,旨在隔离不良行为。虽然这种方法通过抑制了相当一部分奖励函数被滥用现象显示出希望,但它尚未像依赖显式标签的技术那样有效。另一项进展是创建了“rewardspy”,这是一个旨在在强化学习训练期间监控和检测奖励函数被滥用迹象的库,有助于区分真正的策略改进和对奖励函数的利用。

  5. RESEARCH · CL_79607 ·

    软提示蒸馏增强了设备端大模型的安全性

    研究人员开发了一种新方法,可以使大型语言模型(LLM)在资源有限的设备上使用时更安全、更高效。该技术结合使用“软提示”和蒸馏技术,将安全行为从一个守护模型转移到主LLM。与其他的参数高效方法相比,这种方法显著改善了安全性和可用性的权衡,在推理过程中仅需要极少的额外内存和计算资源。

  6. TOOL · CL_35929 ·

    转向向量提供对LLM语气的直接控制,绕过提示限制

    提示工程在控制大型语言模型(LLM)语气方面通常无效,因为行为特征被编码在模型的内部状态中,而不仅仅是输入提示。一种称为激活转向或使用转向向量的技术可以直接修改这种内部状态来影响模型的输出语气。该方法包括通过比较来自对比提示的模型激活来识别期望的行为方向,然后在生成过程中将该向量添加到模型的隐藏状态。