实体
Corrigibility
Corrigibility
PulseAugur coverage of Corrigibility — every cluster mentioning Corrigibility across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI对齐研究探索类人社会驱动力作为AGI的动机
一篇在Alignment Forum和LessWrong上的帖子,通过借鉴人类的社会和道德驱动力,探讨了未来“类脑AGI”的技术对齐问题。作者认为,如果人类能够实现一个美好的未来,那么足够类人化的AGI也能实现,前提是它们拥有亲社会动机。该帖子深入探讨了特定的人类本能、潜在的失败模式(如不正确的道德圈或权力动态),以及将这些驱动力整合到AGI代码中的实现细节。
-
OpenAI 的 AI 取得进展,但研究人员质疑模型的可修正性和价值观对齐
关于 AI 对齐的讨论引发了对高度强大的 AI 模型是否能质疑自身学到的价值观的担忧,这与人类修正自身信念的方式类似。这凸显了随着模型变得越来越先进,维持 AI 可修正性的挑战。另外,Sam Altman 表示,OpenAI 的 AI 系统现在已经足够智能,能够独立发现新知识并为科学总和做出贡献,这是人类制造的工具首次实现这一目标。