实体
harmlessness
harmlessness
PulseAugur coverage of harmlessness — every cluster mentioning harmlessness across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
AI模型评分:四级制提供可操作的见解,优于二元制
作者讨论了AI模型评分方法上的差异,将自己使用的四级制(FATAL、RISKY、MISSED、HARMLESS)与Hamel Husain推荐的二元制(好/坏)评分进行了对比。Husain认为细粒度评分由于模糊性和缺乏可操作的见解而不可取,但作者认为自己命名的四级制提供了关键的区别。该系统允许在模型发布、工具退役和更换方面做出具体决策,而简单的二元制或平均分数会掩盖这些信息。
-
大语言模型开发者提出基于严重程度的分级,以防止不可逆的错误
一位大语言模型开发者提倡在评估语言模型时采用基于严重程度的分级系统,而非简单的通过/失败计数。提出的方法将失败分为不可逆(致命)、有风险、遗漏或无害,并强调即使总体得分很高,但只要出现一次不可逆错误就应阻止部署。该开发者分享了其在使用有缺陷的评分系统时,错误地惩罚了正确答案的个人经历,并强调了频繁地将模型输出和写入结果保存到磁盘的重要性,以避免数据丢失并便于重新评分。
-
AI奖励模型显示出有用性与无害性之间的张力
一篇新的研究论文探讨了AI奖励模型中“有用性”与“无害性”之间的张力,这是从人类反馈中强化学习(RLHF)的一个关键组成部分。研究发现,在混合目标上训练的模型通常表现不如在单一目标上训练的模型,这表明目标之间存在干扰。通过识别和消融特定的神经元,研究人员观察到这些神经元在因果上支持一个目标,同时对另一个目标产生负面影响,共享神经元在这种对齐张力中起着重要作用。这些发现为理解多目标对齐为何具有挑战性提供了机制性见解,并为开发更分离和可控…