PulseAugur
实时 10:26:25
实体 RPL21

RPL21

PulseAugur coverage of RPL21 — every cluster mentioning RPL21 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_259277 ·

    道德训练增强了大型语言模型的鲁棒性,但可能降低伦理准确性

    研究人员调查了道德推理训练对大型语言模型的影响,特别是 Gemma-2-27B/9B 和 Llama-3.1-8B。他们发现,虽然道德训练增强了合作能力和对抗角色扮演攻击的鲁棒性,但它也可能降低在伦理任务上的准确性。该研究采用了对抗性近端策略优化和表征分析等技术,以了解道德训练如何影响模型行为和内部表征,揭示了鲁棒性提升部分是线性的,部分是电路分布式的。