PulseAugur
中
实时 10:06:54
实体 Anudeex Shetty

Anudeex Shetty

PulseAugur coverage of Anudeex Shetty — every cluster mentioning Anudeex Shetty across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_275237 ·

    研究人员诱导 LLM 产生“醉酒语言”以暴露安全漏洞

    研究人员开发了新颖的方法来诱导大型语言模型(LLM)产生“醉酒语言”,以测试其安全漏洞。通过采用基于角色的提示、因果微调和基于强化学习的后训练,他们观察到五个被评估的 LLM 在越狱和隐私泄露方面的易感性增加。该研究使用了 JailbreakBench 和 ConFaide+ 等基准测试,发现人类醉酒与 LLM 的拟人化之间存在相关性,这表明这些方法可能对 LLM 安全构成重大风险。

  2. TOOL · CL_275236 ·

    VISPA框架在大型语言模型中实现多元对齐

    研究人员开发了VISPA,一个旨在实现大型语言模型多元对齐的新型框架。这种无需训练的方法通过动态选择和引导内部激活,可以直接控制模型表达价值的方式。在各种模型和设置下的广泛研究表明,VISPA在多元对齐方面非常有效,尤其是在医疗保健等高风险领域,为创建能够满足不同观点的语言模型提供了一种可扩展的方法。

  3. TOOL · CL_82649 ·

    新的TRACE方法可检测长文本中的大型语言模型代笔

    研究人员开发了一种名为TRACE的新方法,用于检测长篇文本中由大型语言模型生成的代笔。该技术通过分析词语排名等令牌级转换模式,并使用一个独立的轻量级语言模型,来创建独特的指纹。TRACE在新数据集GhostWriteBench上展示了最先进的性能,该数据集包含由前沿大型语言模型生成的超过50,000字的文本,并在分布外场景和有限的训练数据下表现出鲁棒性。