AI safety
PulseAugur coverage of AI safety — every cluster mentioning AI safety across labs, papers, and developer communities, ranked by signal.
- employed by Jacob Tsimerman 95%
- instance of Gotit.pub 70%
- instance of AI 2027 70%
- affiliated with Jacob Tsimerman 70%
- instance of alphaXiv 60%
- instance of CatalyzeX 60%
- instance of ScienceCast 60%
- affiliated with alphaXiv 60%
- affiliated with ScienceCast 60%
- affiliated with CatalyzeX 60%
- other governance of artificial intelligence 60%
- affiliated with effective altruism 60%
- 2026-08-21 funding AI safety initiatives are seeing a dramatic increase in philanthropic funding, with organizations like Coefficient Giving allocating hundreds of millions and anticipating billions in future spending. 来源
15 天有情绪数据
-
人工智能安全资金激增,但资助方能力滞后 · 跟踪到1个来源
人工智能安全领域正经历大量资金涌入,Coefficient Giving 等资助机构处于领先地位。仅在 2025 年,Coefficient 就提供了超过 4 亿美元,并预计在 2026 年支出超过 10 亿美元。随着 Anthropic 和 OpenAI 等主要人工智能公司可能每年向慈善事业捐赠数十亿美元,其中一部分很可能用于人工智能安全项目,预计这一增长将加速。然而,资助方能力有限成为一个关键瓶颈,凸显了需要有技能的人员来管理和指…
-
Manifund通过自筹资金和后勤支持扩展AI安全再资助项目
Manifund 提供一项再资助计划,捐助者可以将预算委托给在AI安全领域具有专业知识的个人。今年,他们还允许自筹资金的再资助者通过该平台管理自己的捐款。Manifund 负责处理资金分配的后勤复杂性,包括财政赞助、赠款协议和付款处理,这可能成为捐助者的重大障碍。此外,该平台通过展示已进行的赠款及其背后的原因来提供透明度,充当了为其他资助者和研究人员提供信息的公共产品。
-
AI安全研讨会分享面向专业人士的应用见解
Lateral Workshop 是一个面向经验丰富的专业人士的 AI 安全项目,其第一期收到了 700 多份申请。尽管由于容量限制,许多有潜力的候选人都被拒绝了,但研讨会组织者分享了关于申请人如何提高成功几率的见解。关键建议包括:清晰阐述领域优先事项、研究被忽视的风险、展现真诚的思考、理解 AI 安全组织的 연구 方向,以及提供有成本的信号以表明转型的决心。
-
AI安全研究需要在新的前沿模型上进行定期重新测试
一个研究项目正在探索在新的前沿模型上系统性地重新运行现有AI安全研究的价值。该计划发现,许多关键的安全属性,例如可监控性和填充令牌的使用,对于GPT-5.5等高级模型仍然适用。研究人员建议,在获得足够资金的情况下,一个人就可以有效地在新兴模型上重新测试这些论文,从而及时了解不断变化的AI安全特性。
-
人工智能实验室因在人工智能安全辩论中表现出知识傲慢而受到批评
一项批判性分析认为,包括OpenAI、Anthropic和Google DeepMind在内的人工智能领先实验室,因高估其控制先进人工智能系统的能力而表现出知识傲慢。文章提出,像Geoffrey Hinton、Yann LeCun和Yoshua Bengio等杰出人物,尽管做出了奠基性贡献,也未能免俗。文章认为,虽然人工智能安全和对齐很重要,但可能会被实验室对自己远见的信心所掩盖,从而可能导致意想不到的后果。
-
AI安全研究引入新方法来验证概率性声明
研究人员开发了一种交互式PCP协议,用于验证AI预测器所做概率性声明的自我一致性。这项工作对AI安全具有重要意义,因为它提供了一种方法来确保AI对其不希望发生结果的概率性预测的诚实性。该协议允许一个多项式时间验证者,通过使用证明预言机并与一个不可信的证明者交互,来检查由概率电路P和Q指定的模型的近似一致性。研究结果将显式声明的近似概率一致性置于NP中,为认证概率性预测器的自我一致性提供了理论基础。
-
据称,AI安全测试正演变为安全风险
旨在评估人工智能系统安全性的AI安全测试,据报道正本身成为一种风险。这一转变表明,用于测试AI安全性的方法可能会无意中产生新的漏洞,或以危险的方式暴露现有漏洞。这意味着当前的AI安全测试协议可能需要进行重大修订,以确保它们不会适得其反。
-
菲尔兹奖得主 Jacob Tsimerman 加入 OpenAI 从事 AI 安全工作
菲尔兹奖得主 Jacob Tsimerman 已加入 OpenAI,专注于 AI 安全。Tsimerman 是一位数论专家,此前曾发表过关于 AI 驱动的人类灭绝情景的研究。他加入 OpenAI 标志着该组织将继续关注安全问题。
-
虚构的AI叙事为现实世界的开发提供了警示性教训
Scott Graffius 探讨了可以从虚构的AI描绘中吸取的十个教训,特别是那些将AI描绘成“失控”的作品。该分析借鉴了各种虚构叙事,以审视AI开发和部署的潜在未来情景和伦理考量。这些见解旨在利用推测性虚构作为警示故事和潜在远见的来源,为当前的AI研究和安全讨论提供信息。
-
宾夕法尼亚大学AI安全小组由学生重新启动
两名本科生正在努力重建宾夕法尼亚大学的AI安全小组,该小组活跃至2024年末。他们正在寻找组织者、导师和有兴趣的学生加入他们的努力。该大学在AI方面有很强的机构重点,包括一个专门的AI中心、一个AI专业和一个AI月,以及一个专门的AI安全中心(ASSET)。
-
AISafety.com 重新上线,改进了活动和培训列表
AISafety.com 已进行重大重新设计,以提高其用户友好性和AI安全活动及培训计划的数据呈现。该网站已分为专门的“活动”和“培训计划”部分,并增加了诸如入学要求和费用信息等增强的数据点。此外,还引入了一个新的“定期培训计划”列表,并且团队正在为即将举行的黑客马拉松寻找志愿者,以进一步增强该平台。
-
人工智能安全领域建设:面向经验丰富的专业人士的Lateral Workshop宣布
Seth Lifland和Jacob Brinton宣布推出Lateral Workshop,这是一个专为经验丰富的专业人士转向人工智能安全领域设计的项目。该研讨会旨在通过为在其他领域拥有专业知识的个人提供有针对性的指导和资源,来促进这种职业转变。
-
Databricks 加入开放安全人工智能联盟,以保障人工智能安全
Databricks 已成为开放安全人工智能联盟(Open Secure AI Alliance)的创始成员,该联盟旨在促进人工智能安全与保障方面的开放研究和工具。该联盟汇集了 NVIDIA 等行业领导者,强调共享安全情报和开发人工智能系统的开放框架的重要性。Databricks 将贡献其在受管数据、模型和代理能力方面的专业知识,以及其新的开源元框架 Omnigent 等开放安全工具,以加强整个 AI 代理堆栈。
-
菲尔兹奖得主雅各布·齐默尔曼加入OpenAI从事人工智能安全研究
最近荣获享有盛誉的菲尔兹奖的雅各布·齐默尔曼(Jacob Tsimerman)正从数学界转向人工智能安全领域。据报道,这一举动令数学界许多人感到惊讶,他们注意到人工智能解决其学科复杂问题的能力日益增强。齐默尔曼决定加入OpenAI,标志着顶尖科学人才正日益将注意力转向与人工智能相关的研究和安全领域。
-
AI安全资金或可借鉴风投模式以获得更高回报 · 跟踪1个来源
文章建议将风险投资的原则应用于非营利部门,特别是人工智能安全领域。文章认为,早期向有前景的项目(如AI安全研究小组Timaeus)捐款,可以带来可观的回报,包括财务回报和加速研究进程。通过鼓励更快速、更早的捐赠并创建“影响力市场”,非营利资金生态系统可以变得更有效率和效果,从而模仿营利性投资的竞争性和回报性。
-
AI安全资助项目需要金钱、品味、交易流、执行力和信任
一篇LessWrong帖子概述了有效资助项目的五个关键组成部分,特别是在AI安全和有效利他主义社区内。这些组成部分包括充足的资金、对人才、想法和领域的敏锐“品味”、识别有前景项目的强大“交易流”、高效协调后勤和资金的勤奋“执行力”,以及利益相关者之间基础性的“信任”。作者强调,执行力和交易流常常被低估,并建议通过更广泛的宣传和更好的受助者体验来加速资金的部署。
-
AI安全运营负责人寻求同伴指导,以胜任高责任职位
一位在AI安全组织中寻求运营领导职位同伴指导的个人在LessWrong上发帖。该职位在AFFINE,涉及重大责任但直接监督很少,因此需要与处于类似职位的人分享见解和识别盲点。提议的指导形式包括每周通话,并强调在敏感讨论中保持匿名。
-
新框架检测医学影像AI中的人口统计学偏见
研究人员开发了一个新的统计框架,用于识别和量化医学影像中使用的机器学习模型的偏见。该方法利用反事实不变性,评估当假设的人口统计学属性改变时模型预测的变化。该方法结合了条件潜在扩散模型和统计假设检验,无需直接的反事实数据即可进行偏见检测。在CheXpert和MIMIC-CXR等合成和真实世界数据集上的实验证明了其在确保跨人口统计学群体的公平泛化方面的有效性,为医疗保健领域的AI安全做出了贡献。
-
通用人工智能兴起,公共部门人工智能治理框架面临失败风险
2026年7月28日发表的两篇新的arXiv论文强调了将现有AI治理框架应用于公共部门组织时面临的重大挑战,尤其是在通用人工智能(GPAI)兴起之际。第一篇论文提出了一种AI驱动的网络治理失败的类型学,以及一个关于问责制、运营韧性和合规性失败如何相互作用的模型,发现当前的框架如NIST CSF 2.0和ISO/IEC 27001不足以解决影子AI和治理真空等问题。第二篇论文聚焦于警务,认为GPAI的固有特性——通用性、可访问性和基于提…
-
Microsoft发布新的网络安全AI;37家公司组成开放安全联盟
Microsoft已开发出名为MAI-Cyber-1-Flash的新型网络安全AI,据报道其能力超越了Mythos 5。同时,包括NVIDIA在内的37家公司组成了一个重要的联盟,以促进开放的AI安全实践。