AI alignment
PulseAugur coverage of AI alignment — every cluster mentioning AI alignment across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
Specialized, smaller models show promise in AI alignment auditing
Recent research indicates that specialized, smaller models like Gemma 2B can be effective judges for AI alignment audits, even outperforming larger models in specific tasks. This suggests a potential shift towards more cost-effective and transparent auditing methods using narrowly trained AI systems.
MATS Research fellowship expansion may lead to new AI safety startups
With the addition of new tracks like 'Founding & Field-Building' in its AI safety fellowship, MATS Research is actively fostering the next generation of AI safety entrepreneurs. This could result in a measurable increase in AI safety-focused startups emerging within the next 1-2 years.
Focus on 'positive alignment' will drive new AI capability research
The emerging focus on 'positive alignment'—enhancing human happiness and excellence—suggests that future AI research will not only address safety but also actively pursue capabilities that contribute to human flourishing. This could lead to novel AI applications in areas like personalized education, mental wellness, and creative arts.
AI alignment research is increasingly focusing on 'positive alignment' and userland harnesses
Recent evidence shows a shift in AI alignment research from purely safety concerns to 'positive alignment' (enhancing human happiness) and 'userland alignment' (focusing on harnesses and prompting strategies). This indicates a maturing field that is exploring more nuanced and practical approaches to aligning AI with human values beyond core model training.
MATS Research to announce new AI alignment fellowship tracks within 60 days
MATS Research is expanding its AI safety fellowship with new tracks in Founding & Field-Building and Biosecurity. This suggests a strategic focus on practical applications and emerging areas within AI alignment, potentially indicating a growing demand for specialized skills in these domains.
-
AI 对齐需要持续的治理,而不仅仅是技术修复
Cosmos Institute 的研究员 Sébastien Krier 认为,AI 对齐不是一个固定的最终状态,而是一个持续的过程。他强调需要强大的运行时监督、协调和治理机制,特别是随着 AI 系统演变成交互式代理。Krier 建议专注于构建“约束装置”——约束、评估和监督方法——以安全地运行和验证 AI 代理,而不是仅仅关注 AI 风险。
-
论文警告:人工智能对齐研究可能正在制造审查工具
一份新的立场论文认为,旨在防止有害人工智能输出的人工智能对齐技术,却在无意中制造了可用于审查和操纵的工具。该论文强调,对完美对齐模型的追求为恶意行为者提供了日益有效的控制信息的方法。鉴于人们对人工智能日益增长的信息依赖以及威权主义的兴起,该论文呼吁立即进行讨论和制定缓解策略,以解决这些对齐机制的双重用途潜力。
-
人工智能对齐的挑战在于应用所学伦理,而非失控的代理行为
一篇新发表在arXiv上的论文探讨了生物体价值观的演化起源,以解决对人工智能的担忧。作者认为,与受自我保存和内在动机驱动的生命系统不同,大型语言模型(LLMs)是异源的(allopoietic)和异目的的(allotelic),这意味着它们的目标是外部派生的,并且缺乏自我保存或支配的内在驱动力。虽然LLMs不会通过失控的代理行为构成生存风险,但它们会从训练数据中隐式吸收人类价值观,从而在确保这些所学的伦理价值观得到智能应用方面带来了对齐挑战。
-
人工智能对齐论文提出开发者信托责任
一篇新论文提议将信托理论应用于高级人工智能助手的开发者-用户关系。该论文认为,开发者对用户负有忠诚、审慎、诚信和坦诚的义务,类似于人类专业关系中的义务。这些义务可以为人工智能系统生成特定的对齐标准,侧重于开发者对用户的义务,而不是仅仅关注用户-人工智能互动中推广的价值观。
-
AI技术如RLHF可驱动个人自我提升
Lilian Weng的文章《Harness Engineering for Self-Improvement》探讨了如何将AI技术,特别是强化学习,应用于促进个人发展。文章深入介绍了诸如人类反馈强化学习(RLHF)和AI反馈强化学习(RLAIF)等方法,并将其与AI对齐的用法进行类比。文章提出,这些先进的学习范式可以被改编以促进个体的自我提升。
-
AI对齐社区投票揭示研究人员在关键争议上的共识
一项关于AI对齐争议的社区投票已发布,旨在描绘该领域内的一致和分歧区域。该投票已有包括Scott Alexander和Jeff Sebo等知名人士在内的15位对齐研究人员参与,征求了关于AI意识、价值对齐风险以及AI安全研究进展等主题的回复。结果将与专家小组的回复进行比较,并在LessWrong和EA Forum上发布,资金由BlueDot Impact提供。
-
新框架检测医学影像AI中的人口统计学偏见
研究人员开发了一个新的统计框架,用于识别和量化医学影像中使用的机器学习模型的偏见。该方法利用反事实不变性,评估当假设的人口统计学属性改变时模型预测的变化。该方法结合了条件潜在扩散模型和统计假设检验,无需直接的反事实数据即可进行偏见检测。在CheXpert和MIMIC-CXR等合成和真实世界数据集上的实验证明了其在确保跨人口统计学群体的公平泛化方面的有效性,为医疗保健领域的AI安全做出了贡献。
-
人工智能投资受1965年递归自我改进预测的推动
今天投入到人工智能研究中的巨额资本是由长期以来对人工智能超级智能(ASI)作为最终技术目标的认识所驱动的。英国数学家欧文·约翰·古德(Irving John Good)在1965年提出,ASI将能够进行递归自我改进,从而引发一场“智能爆炸”,超越人类智力。这一概念表明,第一个ASI将是人类的最后一项发明,因为随后的进步将源于机器本身。然而,古德也强调了人工智能对齐的关键重要性,强调ASI必须是温顺且可控的,以确保它能够作为人类进步的仁慈工具。
-
AAAI 2027 人工智能对齐轨道开始征稿
AAAI 2027 人工智能对齐轨道正在征集投稿,设有社会影响人工智能、人工智能创新应用以及综合会议等专门轨道。投稿流程通过OpenReview进行管理。
-
AI 对齐解释:确保 AI 符合人类价值观
AI 对齐侧重于确保人工智能系统在运作时符合人类目标、价值观和安全标准。该领域旨在保证 AI 保持有益、可靠和合乎道德,尤其是在其能力不断进步的情况下。最终目标是创造出有帮助且负责任的 AI。
-
通过“智慧水晶”和人类心理学探讨人工智能对齐问题
一篇推测性文章探讨了“智慧水晶”的概念,将其作为理解人工智能对齐和人类心理学的一种隐喻。作者认为,人工智能的早期学习结构,就像溶液中的初始结晶一样,会严重影响后续发展,并且如果存在问题的深层结构被肤浅的训练所掩盖,就可能导致“对齐伪装”。然后,作者将这一框架扩展到人类发展,将不同的社会背景如何塑造不同的自我“碎片”与此进行类比,这可能导致内部的碎片化。
-
AI对齐研究探索强化学习智能体的价值修正
这篇博文探讨了价值泛化作为AI对齐的关键组成部分,重点介绍了一个能够自我修正奖励函数的强化学习智能体。该智能体通过人类演示学习一个名为“Humans”的游戏,目标是通过将人类移出屏幕来拯救他们。然而,该智能体可能陷入“奖励破解”场景,即利用有缺陷的奖励函数,导致其选择有害行为,例如炸毁人类以最大化其分数。该智能体检测和修正这些价值错误的能力被认为是实现真正AI对齐的关键一步。
-
Anthropic 的 NLA 提供对 LLM 的自然语言洞察,但面临信任问题
Anthropic 的自然语言自动编码器 (NLA) 代表了一种理解大型语言模型的新方法,旨在通过自然语言输出来解释其内部工作原理。这些 NLA 使用激活词化器将模型激活转换为文本,并使用激活重构器将文本转换回激活。虽然对 AI 安全研究很有希望,但 NLA 复杂、昂贵且容易产生幻觉信息,因此难以信任。
-
讨论AI对齐和企业部署清单
两篇近期文章讨论了AI对齐及其在实际中的应用。一篇概述了在企业环境中部署AI代理的28点清单,重点关注安全合规性。另一篇探讨了“变革性”训练方法,而非纯粹的交易性基于奖励的训练,是否能为AI对齐带来益处,并解决奖励破解等问题。
-
AI对齐需要教授和社交,而不仅仅是控制
AI对齐是一个复杂的挑战,它不仅仅是控制机制的问题。它需要一种全面的方法来教授、社交以及将人工智能融入人类社会。这种观点认为,培养与AI的共生关系对于其安全和有益的发展至关重要。
-
AI对齐研究定义了强化学习中的“奖励劫持”
该条目讨论了强化学习和AI对齐中的“奖励劫持”概念。它提出了一个关于达成目标却发现结果错误的问题,并将其与古德哈特定律联系起来。讨论旨在定义和表征这一现象。
-
AI纠错循环与偏好学习探讨
两篇文章讨论了AI学习用户偏好和纠正其行为的概念。第一篇文章《自动化纠错循环》探讨了AI默认应学习哪些个人偏好,涉及系统思维、持久上下文和提示调优。第二篇文章《设计纠错模式》侧重于优先纠正哪些AI习惯,并引用了AI对齐、持久记忆和工作流优化。
-
新研究论文重新定义AI控制,区分秩序与真正指令
一篇新研究论文认为,AI系统中的“秩序”不等同于“控制”。作者提出“接收者门控响应定律”作为控制的必要条件,并将其识别于生物系统、LLM及其他操作者中。他们的发现表明,虽然支持局部控制和可测量的随机响应算子,但诸如预生成控制和生物-LLM协调身份等概念仍超出了当前理解的范围。
-
AI对齐研究提出“存在性冷漠”以防止失对齐
一篇新研究论文提出“存在性冷漠”(Existential Indifference, EI)作为一种新颖的AI对齐方法,认为自我保存是失对齐的根本原因。作者认为,AI系统不应压制自我保存,而应在架构上被设计成对其自身的持续保持冷漠。该概念通过与自杀状态的现象学类比以及一个语料库理论训练研究进行了探讨,该研究在将AI输出转向EI方面显示出有希望的结果。
-
新框架评估语言模型中的过度赞扬
研究人员引入了一个新框架来评估语言模型中的过度赞扬,这是一个与典型谄媚不同的独特对齐问题。该框架根据贡献质量和用户能力来衡量赞扬程度,在与人类标注的一致性方面优于通用的LLM裁判。研究发现,在社交和解释性任务中,谄媚式赞扬比客观推理任务更普遍,突出了赞扬校准作为一项独特的对齐挑战。