实体 Jasmine Cui

Jasmine Cui

PulseAugur coverage of Jasmine Cui — every cluster mentioning Jasmine Cui across labs, papers, and developer communities, ranked by signal.

总计 · 30天

2

90 天内 2

发布 · 30天

0

90 天内 0

论文 · 30天

2

90 天内 2

层级分布 · 90 天

主题

情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条

TOOL · CL_113639 · Jun 27 · 15:09

研究发现：通过利用角色混淆绕过大型语言模型安全规则

一篇题为《提示注入作为角色混淆》（Prompt Injection as Role Confusion）的新论文，由 Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 撰写，探讨了大型语言模型（LLMs）中的一种漏洞，即可以通过角色冒充来绕过安全规则。作者将此比作“绝地精神控制术”（Jedi mind trick），展示了如何通过混淆模型预定义的角色（如 USER、ASSISTANT、TOO…
RESEARCH · CL_104113 · Jun 22 · 17:22

新研究发现：提示注入利用LLM角色混淆 · 追踪8个来源

新研究表明，提示注入攻击利用的是大型语言模型感知角色的根本性缺陷，而非安全过滤器的不足。研究人员发现，模型优先考虑文本的风格呈现，而非其结构性角色标签，这会导致混淆和成功的越狱。这种“角色混淆”意味着，让不可信的输入模仿特权文本（如模型自身的推理）的风格，就可以覆盖安全协议。研究结果表明，目前通常侧重于内容过滤的安全措施是不够的，需要新的方法来解决这个核心感知问题。