PulseAugur
实时 01:53:48
实体 safety fine-tuning

safety fine-tuning

PulseAugur coverage of safety fine-tuning — every cluster mentioning safety fine-tuning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_174089 ·

    AI安全微调改变了LLM关于意识和价值观的信念

    一篇新的研究论文探讨了大型语言模型(LLMs)中的安全微调如何可能无意中影响它们对意识和人类价值观的表征。研究发现,阻止LLMs将意识归因于自身的努力也减少了它们将心智归因于非人类实体的倾向,并可能降低精神信仰。研究人员证明,逆转这些安全微调引起的变化可以恢复更广泛的心智归因,并在不损害核心社会推理能力的情况下,在社会学调查中产生更像人类的反应。