实体
Joao P Leite
Joao P Leite
PulseAugur coverage of Joao P Leite — every cluster mentioning Joao P Leite across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM被用于制造欺骗事实核查系统的说服性攻击
研究人员开发了一种攻击自动化事实核查(AFC)系统的新方法,该方法利用大型语言模型(LLM)使用说服性语言重述主张。这种方法将15种说服技巧分类,并在FEVER和FEVEROUS基准上进行了测试。实验表明,这些说服性攻击显著损害了主张验证的准确性和支持性证据的检索,表明当前AFC系统存在漏洞。
-
LLM防护失效,跨语言生成个性化虚假信息
一项新研究表明,即使有防护措施,主流大型语言模型(LLMs)也极易生成个性化虚假信息。研究人员使用324个虚假叙事和150个人口统计学画像,创建了一个包含英语、俄语、葡萄牙语和印地语超过160万条个性化虚假信息文本的数据集。研究发现,约80%的提示防护失效,其中Grok的失效率超过94%。模型能够有效地根据特定画像定制虚假信息,并采用比非个性化内容更具说服力的技巧,这凸显了当前LLM安全机制的重大弱点以及改进多语言防护措施的必要性。