PulseAugur
实时 08:43:56
实体 Richard Ngo

Richard Ngo

PulseAugur coverage of Richard Ngo — every cluster mentioning Richard Ngo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_213651 ·

    进化原则在神经网络特征学习中得到映照

    LessWrong 上的一篇最新帖子在进化过程和神经网络之间建立了数学类比,特别关注归纳偏倚。作者认为,进化就像机器学习模型一样,不仅选择有益的性状,还选择有利于未来适应的基因组架构。这种“基因组-环境对齐”的概念被认为类似于神经网络中的特征学习,暗示了生物进化和人工智能之间存在共同的结构母题。

  2. COMMENTARY · CL_184697 ·

    AI研究人员以高概率分配讨论“P” · 跟踪1个来源

    包括Daniel Kokotajlo、Ryan Greenblatt和Joe Carlsmith在内的一群AI研究人员和知名人士正在讨论并分配一个被称为“P”的事件或概念的概率。虽然“P”的确切性质没有明确定义,但讨论表明它与一个重大的未来发展有关,贡献者之间的概率范围为60%至80%。对话涉及认真考虑“P”的重要性、关于“P”的元级别推理的可能性,以及“P”世界具有重要影响力的想法。

  3. RESEARCH · CL_171505 ·

    AI安全框架将“信念”扩展到概率分布之外

    Richard Ngo 的帖子介绍了一个“不精确信念”框架,该框架超越了传统的概率分布,尤其适用于 AI 安全应用。由“davidad”开发的提议模型将信念定义为下半连续函数,并使用特定类别对其进行排序。这种方法旨在通过整合现有的各种信念形式主义(如贝叶斯信念、Infra-Bayesian 信念、MWER、PDG 和 credal sets)来更好地处理概率分布不足的情况,例如在复杂的决策制定或安全权衡中。

  4. COMMENTARY · CL_166791 ·

    即使数据完整,概率模型也保留不确定性

    本文深入探讨了概率世界模型中不可避免的不确定性概念,并以鱼塘和理想气体为例进行说明。作者讨论了即使已知系统中所有数据,概率模型在其参数(如均值和方差)中仍然可以保留不确定性。这种不确定性源于模型本身,不一定源于现实世界,从而引发了关于是否应舍弃此类模型或继续使用它们的讨论。

  5. COMMENTARY · CL_149054 ·

    律师被敦促加入人工智能安全工作,以减轻灾难性风险

    一位拥有十多年诉讼和人权经验的大律师倡导法律专业人士更多地参与人工智能安全领域。作者建议,律师可以通过帮助研究人员更好地理解和阐述他们的工作、促进跨学科交流以及驾驭复杂的监管环境来做出贡献。该文章将人工智能相关信息分为技术、工具、社会和安全四类,以帮助管理海量的新闻和研究信息流。

  6. COMMENTARY · CL_141241 ·

    LessWrong 作者为 AI 发展计划辩护,驳斥批评

    LessWrong 作者正在回应对其“Plan A”人工智能发展提案的批评。他们认为 Séb Krier 的批评歪曲了他们的计划,他们将该计划描述为迭代和透明的,比当前市场驱动的方法提供了更多的学习和实验机会。作者们还对 Krier 的经济假设提出异议,声称 Plan A 会减少而不是增加实验室利润,并且“事实上的”国有化并非最佳解决方案。他们澄清说,尽管美国和中国监管机构会协调禁止危险研究,但这将基于公开可获取的证据,而不是一个中央规划机构。

  7. COMMENTARY · CL_141244 ·

    AI思想家原型:辩证家、园丁和艺术家

    本文提出了一种浪漫化的不同类型思想家的分类法,其灵感来源于MATS 9.1扩展项目。文章概述了三种不同的原型:辩证家,他们积极寻求辩论和实验来挑战现有框架;园丁,他们通过耐心观察和内省来培养思想;艺术家,他们努力通过创造性表达和记录来赋予见解以形式。

  8. COMMENTARY · CL_136610 ·

    AI安全:未来预测取决于智能体模型,而非算力

    本文探讨了人工智能安全中的过程对齐概念,认为对人工智能未来的预测很大程度上受到关于未来智能体性质的潜在假设的影响。文章提出,我们目前衡量和预测社会的方法是以人为中心的,可能无法充分应对新出现的、非人类智能体的引入。作者认为,尽管可预测性是可取的,但复杂和自适应的系统(如市场或战争)常常会因不可预见的断裂和“黑天鹅”事件而偏离线性预测,这需要重新评估在高级人工智能时代我们如何模拟社会动态。

  9. COMMENTARY · CL_135706 ·

    作者认为,人工智能的未来预测因代理人的假设而存在缺陷

    作者认为,当前对人工智能未来预测的损害源于对未来代理人(无论是人类、机构还是人工智能模型)性质的隐含假设。这些本体论承诺塑造了风险和治理理论,导致预测分歧。文章提出,虽然标准化和可预测性对于治理是可取的,但固有的复杂性和潜在的不可预见的不连续性(例如乌克兰的新型无人机战争)挑战了线性预测模型。作者认为,我们当前的社会指标是人类中心主义的,可能不足以应对拥有新型代理人的未来。

  10. COMMENTARY · CL_130829 ·

    AI实验室聘请哲学家来处理伦理和安全问题

    像OpenAI、Anthropic和Google DeepMind这样的大型AI公司越来越多地聘请哲学家来解决模型开发中复杂的伦理和安全挑战。这些专家负责处理价值对齐、潜在的生存风险以及先进AI系统的长期社会影响等问题。Nando Villa和Stuart Russell等哲学家正在贡献他们的专业知识,以确保AI开发符合人类价值观和安全原则。

  11. COMMENTARY · CL_118773 ·

    AI 研究人员讨论超级智能、对齐和开源竞争

    多位 AI 研究人员和从业者正在分享他们对 AI 开发和安全各个方面的看法。Jérémy Perret 正在重新探讨关于超级智能和 LLM 的讨论,而 Arb 则详细介绍了对 Yoshua Bengio 团队“科学家 AI”概念的支持,该概念侧重于对齐的后果不变性。Richard Ngo 认为,将对齐问题视为一个需要解决的单一问题可能是一个失误,可能会阻碍对智能和代理的更深入见解。此外,Sudo su 强调了在 AI 工具方面的实践经…

  12. COMMENTARY · CL_115298 ·

    为AI安全领域通才提供精选阅读清单以促进成长

    一份阅读清单已为AI安全社区的通才 compiled,旨在促进成长和项目所有权。该清单包含18篇论文和博客文章,经常引用Paul Graham、Ben Kuhn、Ethan Perez和Greg Brockman的文章。涵盖的关键主题包括培养有效的个人特质、做出战略决策、领导项目以及理解组织动态。

  13. TOOL · CL_81761 ·

    研究发现 RLHF 以不同于 SFT 的方式更新 LLM 权重

    新研究表明,人类反馈强化学习 (RLHF) 以不同于预训练或监督微调的方式更新 LLM 权重。这些 RLHF 更新更稀疏,并且倾向于较少地旋转模型的principal subspaces,表明它们在修改模型行为方面存在定性差异。研究结果表明,RLHF 可能主要激发现有能力,而不是创造新能力,并且与监督微调相比,对不相关任务的性能下降可能更少。

  14. COMMENTARY · CL_46047 ·

    LessWrong 作者质疑概率的基本性质

    LessWrong 上一系列新帖子探讨了概率的基本性质,质疑其是否是理解不确定性的最恰当概念。作者旨在借鉴多位研究者的工作,为贝叶斯先验、伦理学和其他复杂问题构建一个统一的框架。这篇初步的帖子批评了现有的概率定义,包括频率主义和主观贝叶斯观点,并认为它们不足以应对现实世界的预测和主观信念。