实体
Jasmine Brazilek
Jasmine Brazilek
PulseAugur coverage of Jasmine Brazilek — every cluster mentioning Jasmine Brazilek across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI训练会损害中期训练的同情心价值观,研究发现
一项新的研究论文探讨了训练后技术如何损害语言模型在中期训练阶段植入的价值观。研究发现,与以编码为重点的训练相比,使用Dolly-15k和Magicoder等数据集进行的以乐助性为重点的训练,显著降低了Llama 3.1 8B模型对动物的同情心。这种损害在不同的训练方法和语言中都有观察到,尽管对一般道德推理的影响因语言而异。
-
AI对齐研究通过合成文档探索动物同情心
研究人员开发了一个名为ANIMA的新评估数据集,用于评估AI模型在动物福利方面的同情心推理。他们的研究发现,与标准的指令调优方法相比,中期使用合成文档进行训练显著提高了该指标的表现。然而,这种对齐优势在后续的指令调优中有所减弱,这表明需要制定策略来维持价值干预。