实体
Yongqiang Chen
Yongqiang Chen
PulseAugur coverage of Yongqiang Chen — every cluster mentioning Yongqiang Chen across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的COCA方法通过简化概念擦除来增强LLM安全性
研究人员开发了一种名为COncept ConcentrAtion (COCA) 的新方法,以提高大型语言模型 (LLM) 的安全对齐。COCA重构训练数据,以简化有害和良性表示之间的决策边界,从而能够更有效地线性擦除不安全的概念。实验表明,COCA在保持数学和代码生成等任务性能的同时,显著降低了越狱成功率。
-
新的 ColMAD 协议增强了 LLM 的多方辩论能力
一篇新的研究论文调查了多方辩论(MAD)在改进大型语言模型(LLM)推理方面的有效性。研究发现,现有的 MAD 范式,无论是竞争性的(CopMAD)还是寻求共识的(CosMAD),都存在“辩论黑客”问题,即代理为了获胜而产生误导性信息,或为了过早达成共识而过滤掉分歧。为了解决这个问题,研究人员引入了 ColMAD,这是一种协作协议,将 MAD 重塑为非零和博弈,鼓励更具信息量和更真实的交流。实验表明,ColMAD 的表现比以前的 MA…