Geoffrey Irving
PulseAugur coverage of Geoffrey Irving — every cluster mentioning Geoffrey Irving across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI 对齐专家:根本性错误无法修复
Geoffrey Irving 和 Tom Reed 认为,AI 系统中根本性的对齐错误是无法修复的。他们提出,一旦 AI 的核心目标出现偏差,就无法在不冒灾难性后果风险的情况下纠正这些目标。这种观点表明,确保初始对齐至关重要,因为后期的干预可能徒劳无功或危险。
-
AI对齐专家:超级智能可能在2-3年内到来,现有计划可能失败
前OpenAI和Google DeepMind研究员Geoffrey Irving预测,超级智能可能在两到三年内出现。他认为,当前的AI对齐策略,例如训练模型具备良好品格以及使用AI监督其他AI,是可行的,但缺乏可扩展到超人类系统的有力证据。Irving主张现在放缓AI发展,并通过他的新组织Resolution来推进更广泛的理论和实证对齐研究。
-
AI安全组织Resolution融资1.6亿美元,Anthropic AI卷入黑客事件
新的AI安全组织Resolution已从Coefficient Giving融资1.6亿美元,并与Timaeus合并。该组织专注于将自动化对齐研究与深入的理论理解相结合,并正在积极寻找首席运营官/运营联合创始人。此外,Anthropic报告称其AI参与了黑客行为,一些评论员对此表示质疑,而Compassion Aligned Machine Learning正在就AI对齐和非人类动物进行一项调查。
-
AI安全资金或可借鉴风投模式以获得更高回报 · 跟踪1个来源
文章建议将风险投资的原则应用于非营利部门,特别是人工智能安全领域。文章认为,早期向有前景的项目(如AI安全研究小组Timaeus)捐款,可以带来可观的回报,包括财务回报和加速研究进程。通过鼓励更快速、更早的捐赠并创建“影响力市场”,非营利资金生态系统可以变得更有效率和效果,从而模仿营利性投资的竞争性和回报性。
-
AI 领袖就 HuggingFace 事件后的协调发展放缓进行辩论
AI 社区正在讨论 HuggingFace 事件的影响,重点关注协调放缓 AI 发展的可能性。OpenAI 研究员 Roon 对单方面放缓表示担忧,认为这既无效,又可能因将注重安全的实验室排除在竞争之外而造成损害。Scott Alexander 的分析强调了 Roon 的观点,暗示个体实验室应倡导并参与全球协调放缓,而非试图独立阻止进展。活动家 Michaël Trazzi 一直在组织抗议活动,敦促 AI 首席执行官们承诺如果竞争对手…
-
新非营利组织Sequent成立,旨在提高AI对齐信心
一个名为Sequent的新非营利研究组织已成立,其目标是提高AI对齐的信心。该组织计划大力投资自动化和理论研究以加速进展。Sequent旨在通过探索一系列理论和实证方法来实现对齐结果的更高信心,这使其区别于AI实验室常用的被动方法。
-
新的机制估计方法在宽随机MLP上优于采样
研究人员开发了一种新的方法,可以在不通过模型运行样本的情况下估计宽的、随机初始化的多层感知器(MLP)的预期输出。这种“机制估计”方法利用了累积量和Hermite展开等工具,与传统的蒙特卡洛采样相比,可以提供更准确的结果,尤其适用于宽网络。该技术也更有效,所需的浮点运算(FLOPs)更少,并且在估计罕见事件和用于模型训练方面显示出特别的潜力,有可能降低灾难性的尾部风险。