Paul Christiano
PulseAugur coverage of Paul Christiano — every cluster mentioning Paul Christiano across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI哲学:LessWrong 网站上关于无限现实的新方法辩论
LessWrong 上最近的一场讨论探讨了为无限现实分配概率的哲学挑战,即“度量问题”。该帖子对比了两种现有方法:客观先验,如 Max Tegmark 青睐的简洁性先验,以及“关怀度量”,其中偏好决定概率,由 Wei Dai 和 Paul Christiano 等人支持。这两种方法都存在显著的缺点,促使作者考虑 Toby Ord 最近使用超实数作为评估无限的一种潜在第三种选择的工作。
-
OpenAI 因安全担忧解散 AI 灾难风险团队
OpenAI 已解散其 Superalignment 团队,该团队致力于减轻灾难性 AI 风险。该团队的职责已分配给公司内部其他小组,导致一些安全研究人员离职。据报道,此举引起了员工的不安,他们担心 OpenAI 可能没有充分优先考虑安全性。
-
AI研究人员以高概率分配讨论“P” · 跟踪1个来源
包括Daniel Kokotajlo、Ryan Greenblatt和Joe Carlsmith在内的一群AI研究人员和知名人士正在讨论并分配一个被称为“P”的事件或概念的概率。虽然“P”的确切性质没有明确定义,但讨论表明它与一个重大的未来发展有关,贡献者之间的概率范围为60%至80%。对话涉及认真考虑“P”的重要性、关于“P”的元级别推理的可能性,以及“P”世界具有重要影响力的想法。
-
LessWrong 帖子:形而上学是功能决策理论辩论的关键
一篇 LessWrong 帖子认为,围绕功能决策理论(FDT)的讨论常常忽视了至关重要的形而上学基础。作者认为,要证明 FDT 的建议是合理的,尤其是在勒索等场景中,就必须探讨诸如平行现实、改变过去的可能性或决策过程的柏拉图主义观点等概念。该帖子批评了常见的在线辩论,认为它们侧重于语义分歧,而不是这些根本性的形而上学问题,而作者认为这些问题才是 FDT 辩论的真正症结所在。
-
新基金将通过20万美元的赠款和奖金来推动AI可修正性研究
一个新的可修正性研究基金已启动,由Lightcone Infrastructure管理,旨在显著增加对AI可修正性的研究。该基金由慈善家Peter McCluskey资助,将于2026年通过赠款和奖金分发至少20万美元。可修正性被视为一种有前景的方法,通过设计使AI系统服从人类原则而非独立判断的AI系统,来确保先进AI与人类价值观保持一致。
-
LessWrong 将决策理论重构为承诺理论
一篇 LessWrong 帖子提议将决策理论概念,特别是函数式决策理论(FDT),重构为“承诺理论”。这种新视角旨在使 FDT 的建议更容易被接受,因为这些建议通常被认为违反直觉。作者使用 William MacAskill 的“炸弹”场景来说明 FDT 的逻辑如何导致选择一个装有炸弹的盒子,而许多人认为这一结论是荒谬的。提议的承诺理论框架表明,核心问题不在于决策本身存在缺陷,而在于考虑“与过去的自己合作”。
-
AI实验室聘请哲学家来处理伦理和安全问题
像OpenAI、Anthropic和Google DeepMind这样的大型AI公司越来越多地聘请哲学家来解决模型开发中复杂的伦理和安全挑战。这些专家负责处理价值对齐、潜在的生存风险以及先进AI系统的长期社会影响等问题。Nando Villa和Stuart Russell等哲学家正在贡献他们的专业知识,以确保AI开发符合人类价值观和安全原则。
-
AI安全社区很少关注直接的超级智能对齐
LessWrong 上的一篇最新帖子指出,AI安全社区中直接从事超级智能对齐研究的人员比例之少令人惊讶。作者提到,虽然许多人从事能力评估、风险评估和政策等相关领域的工作,但专注于确保未来超级智能AI与人类价值观保持一致的人却较少。帖子中提到的致力于对齐研究的特定组织包括Alignment Research Center、Sequent以及GDM的部分团队,还有一些零散的大学个人。
-
AI对齐辩论:可纠正性真的可取吗?
LessWrong上的一篇文章质疑了让AI系统“可纠正”(corrigible)的愿望,这种特性允许人类轻松纠正它们的错误。作者认为,关注可纠正性忽略了谁将实际掌握这种权力以及他们的意图可能是什么。与其是仁慈的人类,不如是特定的个人或团体将控制可纠正的AI,这可能导致它们被滥用于获取权力或无约束地服从主导群体。
-
AI风险评估:事实生成 vs. 证据分析
本文探讨了AI开发中第三方风险评估的各种维度。它区分了事实生成和证据分析,并强调了像红队测试这样的对抗性过程最能从独立的第三方那里获益,以确保真正的努力并避免消极怠工。作者还指出,专业知识、敏感信息访问权限以及开发人员操纵评估分数的可能性是确定外部审计员必要性时需要考虑的关键因素。
-
LessWrong 作者质疑概率的基本性质
LessWrong 上一系列新帖子探讨了概率的基本性质,质疑其是否是理解不确定性的最恰当概念。作者旨在借鉴多位研究者的工作,为贝叶斯先验、伦理学和其他复杂问题构建一个统一的框架。这篇初步的帖子批评了现有的概率定义,包括频率主义和主观贝叶斯观点,并认为它们不足以应对现实世界的预测和主观信念。
-
新的机制估计方法在宽随机MLP上优于采样
研究人员开发了一种新的方法,可以在不通过模型运行样本的情况下估计宽的、随机初始化的多层感知器(MLP)的预期输出。这种“机制估计”方法利用了累积量和Hermite展开等工具,与传统的蒙特卡洛采样相比,可以提供更准确的结果,尤其适用于宽网络。该技术也更有效,所需的浮点运算(FLOPs)更少,并且在估计罕见事件和用于模型训练方面显示出特别的潜力,有可能降低灾难性的尾部风险。