PulseAugur
实时 08:56:32
实体 LMSYS-Chat-1M

LMSYS-Chat-1M

PulseAugur coverage of LMSYS-Chat-1M — every cluster mentioning LMSYS-Chat-1M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_254143 ·

    研究显示用户在5%的对话中虐待AI聊天机器人

    arXiv上的一篇新论文探讨了用户对会话式AI系统的虐待行为,分析了LMSYS-Chat-1M数据集中的777,000多条对话。研究发现,大约5%的用户回合表现出针对AI的敌意、侮辱、威胁或胁迫。有趣的是,用户敌意在不同模型之间存在显著差异,这似乎是由于吸引到每个模型的用户群体造成的,而不是模型自身的行为。研究还指出,AI的道歉与用户敌意的增加有关,但总体上道歉更频繁的模型受到的敌意却更少。

  2. RESEARCH · CL_11474 ·

    研究人员通过激活信号检测多轮 LLM 攻击

    研究人员开发了一种名为 Latent Adversarial Detection 的新方法,用于识别针对大型语言模型的多轮提示注入攻击。该技术分析模型残差流内的内部激活模式,识别出一种称为“对抗性不安”的信号,该信号表明存在恶意意图。通过提取五个标量轨迹特征,该系统显著提高了检测率,在合成数据上达到了 93.8% 的准确率,并展示了其在实际应用中的潜力。