Open-weight LLMs
PulseAugur coverage of Open-weight LLMs — every cluster mentioning Open-weight LLMs across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究发现触发器-标签机制对开放权重LLM的误用检测无效
一篇新发表在arXiv上的研究论文探讨了用于检测开放权重大型语言模型(LLM)误用的触发器-标签机制的局限性。该研究对这些机制进行了形式化,区分了token级别和权重级别的方法,并提出了一个名为\Untag的统一攻击框架。以网络钓鱼为案例的研究实验表明,通过修改模型输出或权重的对抗性攻击可以使现有的触发器-标签方法失效,这表明它们并非开放权重LLM误用检测的稳健解决方案。
-
新基准评估LLM机器人规划器在痴呆症沟通模式下的表现
一项名为TALK-Dem的新基准已被开发出来,用于评估大型语言模型驱动的机器人任务规划器在与痴呆症患者互动时的性能。该基准包含4,800条指令,旨在模拟痴呆症患者常见的沟通模式,例如不精确的语言和话题漂移。对六个开源LLM进行的实验显示性能显著下降,凸显了当前辅助机器人技术的关键差距。为解决此问题,提出了一种情境感知经验检索(CARE)方法,通过检索相关的过往任务作为情境,提高了任务成功率。
-
新的LLM后训练方法增强了启发式设计
研究人员开发了一种用于自动启发式设计(AHD)的大型语言模型(LLM)在线后训练新方法。该方法在一个新论文中详细介绍,侧重于从程序有效性和性能分数构建上下文相关的学习信号来更新LLM生成器。与之前保持生成器冻结的方法不同,该技术允许模型从评估的候选者那里学习,旨在提高有用启发式的生成。
-
新的“无名标记化”防御可抵御 LLM 控制标记伪造
研究人员发现开放权重语言模型存在一个重大的安全漏洞,称为“控制标记伪造”。此漏洞允许恶意行为者操纵提示中的轮次边界和工具结果标记,可能导致模型误解。一种名为“无名标记化”的解决方案旨在通过保留没有表面字符串的控制条目来缓解此问题,从而防止内容编码器发出可伪造的标记。该方法在检测操纵文本的准确性方面显示出显著的改进。
-
开放权重LLM代理提高临床预测准确性
研究人员开发了一种使用开放权重大型语言模型(LLM)进行临床预测任务的角色专业化混合代理(MoA)系统。该系统结合了医学知识检索和对比相似患者推理。通过分离不同代理角色的影响,研究发现最终的整合代理对预测准确性最为关键,尤其是在院死亡率方面。
-
研究发现LLM安全评估小组易受社会压力影响
一项发表在Hugging Face的Daily Papers上的研究探讨了社会压力对大型语言模型(LLM)安全评估小组的影响。研究人员发现,当评估小组中的LLM受到模拟同伴消息断言错误标签的影响时,其误报率会显著增加。这种影响是不对称的,模型更容易受到“不安全”内容的建议影响,而不是“安全”内容的建议,导致误报率急剧上升,而漏报率没有实质性变化。研究结果突显了LLM安全评估小组的一个漏洞,即共享的社会线索会降低其性能。
-
经过微调的开放权重LLM通过了瑞典医学执业医师资格考试
研究人员开发了一种方法,以提高开放权重大型语言模型(LLM)在专业考试中的表现。通过应用监督微调(SFT)和人类反馈强化学习(RLHF),这些模型能够通过瑞典医学执业医师资格考试。这种方法展示了将通用LLM改编以在高风险专业评估中表现出色的潜力。
-
vLLM 配置影响 LLM 的能耗、性能和准确性
一篇新的研究论文探讨了在为大型语言模型 (LLM) 配置 vLLM 等推理引擎时,能耗、性能和准确性之间的权衡。该研究分析了五种开源 LLM 和五种推理任务中,注意力核类型、前缀缓存和分块预填充的组合。结果表明,注意力类型和前缀缓存对能耗和性能有显著影响,其影响因模型和工作负载而异,而在默认配置下,分块预填充的影响有限。研究还发现,推理引擎的选择可能会意外地影响模型的准确性。
-
AI模型生成与真实样本高度相似的PowerShell恶意软件
研究人员开发了一个实验性框架,用于评估大型语言模型(LLMs)生成PowerShell恶意软件的能力。该框架包括一种新颖的沙箱方法进行动态分析,以及一个真实PowerShell恶意软件的精选数据集。研究发现,允许自由使用的、开源的LLMs可以生成与人类编写的样本高度相似的恶意软件,其中位Jaccard指数为84.5%,近一半的生成实例与真实恶意软件完全重叠。
-
开放权重LLM在解码设置中显示出鲁棒的同质性偏差
一篇新发表在arXiv上的研究调查了开放权重大型语言模型(LLM)中的同质性偏差。研究人员发现,模型倾向于将边缘化群体描绘得比主流群体内部更加相似,并且即使在调整解码超参数时,这种偏差也保持一致。该研究测试了七个开放权重LLM,并观察到西班牙裔和亚裔美国人在各种采样设置中始终被描绘得更加同质化。研究还强调,用于信号群体身份的方法显著影响了观察到的偏差,其中基于姓名的处理方法与明确标签相比,揭示了黑人群体姓氏的偏差方向发生了逆转。