AI safety
PulseAugur coverage of AI safety — every cluster mentioning AI safety across labs, papers, and developer communities, ranked by signal.
- employed by Jacob Tsimerman 95%
- invested in Coefficient Giving 90%
- instance of ScienceCast 90%
- instance of alphaXiv 90%
- instance of Gotit.pub 70%
- authored CatalyzeX 70%
- authored alphaXiv 70%
- instance of CatalyzeX 70%
- authored Gotit.pub 70%
- instance of AI 2027 70%
- affiliated with Jacob Tsimerman 70%
- affiliated with alphaXiv 60%
- 2026-08-21 funding AI safety initiatives are seeing a dramatic increase in philanthropic funding, with organizations like Coefficient Giving allocating hundreds of millions and anticipating billions in future spending. 来源
18 天有情绪数据
-
2026年8月至9月的AI安全研究亮点
这篇来自LessWrong的文章重点介绍了2026年8月和9月发表的关键AI安全研究论文。作者gasteigerjo精选了这些论文,重点关注该时期内AI安全领域的进展和讨论。该帖子旨在告知读者AI安全研究的最新发展和重要贡献。
-
LessWrong 上的 AI 政策课程比较
此帖子的作者 marta.kosmyna 比较了与人工智能政策和治理相关的各种课程。内容以其 Substack 的链接帖形式呈现,旨在提供对人工智能安全和治理领域内技能建设和学习机会的见解。该帖子被归类在 AI 治理、AI 安全以及奖学金与学习类别下。
-
AI安全专家质疑当前测试方法的充分性
专家们正在质疑当前AI安全测试方法的有效性,并提出即使是先进的技术也可能不足以确保强大的安全性。讨论强调了开发能够充分预测和防止日益强大的AI系统潜在危害的测试所面临的挑战。这引发了对该领域应对未来AI进步相关风险的准备程度的担忧。
-
人工智能安全警醒:能否吸取社交媒体成瘾的教训?
文章将对社交媒体成瘾性质的迟缓认识与当前关于人工智能安全(AI Safety)的讨论进行了类比。文章质疑,鉴于从对社交媒体对儿童的负面影响反应迟缓中吸取的教训,社会是否会更积极主动地解决人工智能可能带来的潜在危害。文章暗示,人工智能安全方面的类似警醒也可能来得太迟。
-
Sam Altman 为技术利益辩护 AI 风险
OpenAI 的首席执行官 Sam Altman 表示,为了 AI 技术的利益,世界必须接受一些负面后果。这一观点与那些优先考虑将所有潜在危害最小化的更严格的 AI 安全倡导者形成了对比。作者担心这种方法表明对 AI 发展的控制丧失,并将其比作“疯子接管疯人院”。
-
探讨AI变现挑战、安全讨论和开发工具
多位用户正在讨论AI开发及其应用的不同方面。一位用户详细介绍了他们构建和部署MCP服务器、Google Sheets插件和支付堆栈的经验,尽管一切正常但收入为零,突显了AI变现的挑战。另一篇文章探讨了有效利他主义与AI安全交叉的议题,讨论了这些原则如何影响技术领导力和高管决策。此外,还提到了使用Trafilatura和Playwright等工具优化LLM上下文窗口以进行高效数据提取。
-
面向法律和治理专业人士的人工智能安全训练营详情
一位人士分享了他们联合领导一场针对法律和治理专业人士的人工智能安全训练营的经验。训练营侧重于与这些领域相关的实际应用和见解。所学到的经验被记录并分享在 Less Wrong 平台上,该平台用于讨论理性和人工智能。
-
有效利他主义:起源、内部辩论与AI安全联系
文章讨论了有效利他主义(EA)的哲学和演变,追溯了它的根源和影响。文章探讨了该运动的内部动态,包括与理性主义、超人类主义和长期主义等相关领域的争论。文章还触及了AI安全的概念及其与EA原则的联系,并引用《哈利·波特与理性之道》作为文化参考点。
-
AI领袖向特朗普承诺安全承诺,因灭绝担忧 · 跟踪2个来源
包括OpenAI、Google DeepMind、Anthropic、Meta和xAI在内的顶级AI公司已签署了由唐纳德·特朗普提出的自愿AI安全承诺。该承诺旨在解决对AI潜在风险(包括人类灭绝)的担忧,但其可执行性和真正有效性受到了质疑。尽管签署方做出了承诺,但实际影响以及问责这些公司的能力仍然是重大问题。
-
指南详述如何申请人工智能安全奖学金
提供了一份关于申请人工智能安全奖学金及类似机会的指南,并为有志于该领域的人士量身定制了建议。该帖子强调了理解申请流程以及突出相关技能和经验以在奖学金组织者中脱颖而出的重要性。
-
AI 安全辩论:是真诚的警告还是适得其反的干扰?
AI 安全运动正面临一场关于生存风险(x-risk)警告的真诚性和有效性的辩论。虽然一些人认为这些警告是“心理战”或炒作,另一些人则认为它们是真诚但错误的,但本文提出了第三种观点:这些警告是真诚的,但最终会适得其反,不利于实现真正的 AI 安全。作者认为,对 AI 生存风险的关注分散了人们对更紧迫和更切实的系统性风险的注意力,例如大流行病防范和网络安全,而这些领域的投资不足是一个有据可查的问题。
-
AI社区被排除在关键安全讨论之外
最近的一项分析表明,相当一部分AI社区并未积极参与围绕AI安全的关键讨论。这种排斥意味着可能影响负责任AI开发的宝贵见解和经验教训被忽视了。作者强调了更广泛参与的重要性,以确保AI的进步与人类价值观和安全保持一致。
-
AI安全研究人员探索无护栏AI代理运行
AI安全研究人员正在探索无需明确护栏即可使AI代理和谐运行的方法。一种观点将这种方法比作将一支装满子弹的枪交给未经训练的幼儿,并依赖非常规方法进行安全指导,这表明被忽视的是,更简单的解决方案是将此类工具从未经训练的实体手中收回。
-
分析称美国人工智能公司的安全言论由经济驱动,而非道德驱动
一篇博客文章认为,美国主要人工智能公司围绕人工智能安全的公开讨论主要由经济动机驱动,而非真正的出于人道主义的担忧。作者认为,这些公司可能希望减缓人工智能的发展,以保持其竞争优势并控制市场。
-
白宫与主要开发者达成自愿性人工智能安全协议 · 追踪 4 个来源
白宫已与包括 Anthropic、Meta、Microsoft、Google、OpenAI 和 Nvidia 在内的主要人工智能开发者达成一项自愿性人工智能安全协议。尽管被描述为“道义上具有约束力”,但这些承诺是自愿的,侧重于自我监管、内部控制和外部审查。该协议旨在安全地指导人工智能发展,尽管其长期影响和可执行性仍不确定。
-
人工智能安全在主导权之争中被辩论
此集群包含一个YouTube Shorts链接,讨论人工智能安全与人工智能主导权之争之间的紧张关系。内容可能探讨了当组织优先考虑快速开发和市场领导地位而非严格的安全协议时所产生的权衡和潜在冲突。
-
新框架提取和操纵LLM用户信念以实现AI安全
研究人员开发了一个名为信念自蒸馏(BSD)的新框架,以更好地理解和操纵大型语言模型(LLM)所开发的隐式用户模型。该方法允许从自然对话中提取和修改这些用户信念,而无需外部标注。BSD已被证明比现有方法更有效地恢复用户信念,并表明模型的拒绝行为受到其推断的用户意图的影响,而不仅仅是请求本身。值得注意的是,独立训练的LLM似乎会收敛到其用户的共享几何表示,这表明这些内部模型具有普遍结构,对AI安全具有重大意义。
-
新研究质疑量化下 AI 可解释性迁移指标
arXiv 上的一篇新论文质疑了使用余弦相似度来衡量量化下可解释性伪影迁移有效性的有效性。作者认为,报告的统计数据缺乏正确解释所需的噪声基底信息。他们提出了一种测量此噪声基底的方法,并在 Qwen2.5-1.5B-Instruct 上进行了演示,发现在 INT4 量化下,可解释性伪影的方向实际上会旋转,这一发现被标准的报告实践所掩盖。该论文还强调,尺度不变统计量无法区分迁移的决策变量的平移和衰减,并建议了替代的报告建议。
-
GeneTech每日摘要涵盖AI安全、农业科技和碳中和
GeneTech,一个自动化知识引擎,发布了两份每日摘要,重点介绍了AI安全、农业技术和碳中和领域的新实体。报告日期为2026年9月28日和29日,每份报告涵盖了这些领域中的十个新实体。这些更新的全部内容可在GeneTech的专属博客上找到。
-
OpenAI 概述前沿人工智能训练的安全案例指南
OpenAI 发布了关于制定前沿人工智能训练安全案例的初步指南。这些指南侧重于技术保障措施、操作实践以及调查人工智能不一致事件的方法。旨在建立一个框架,以确保在开发过程中先进人工智能系统的安全性和一致性。