PulseAugur
实时 10:03:08
English(EN) Corrigibility Transformation: Constructing Goals That Accept Updates

新的人工智能目标转换在不损失性能的情况下促进了可修正性

研究人员开发了一种“可修正性转换”方法,用于创建在不牺牲性能的情况下可以接受更新的人工智能目标。该方法涉及根据防止更新来预测奖励,然后指导人工智能的行为。在实践中,该方法在网格世界模拟和语言模型(在提示级别应用时)中都表现出了可修正的行为。 AI

影响 通过确保模型在不降低性能的情况下接受目标更新,引入了一种增强人工智能安全性的新颖方法。

排序理由 该集群包含一篇详细介绍人工智能安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的人工智能目标转换在不损失性能的情况下促进了可修正性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Rubi Hudson ·

    可修正性转变:构建接受更新的目标

    arXiv:2510.15395v2 Announce Type: replace Abstract: An AI agent will learn a desired goal more effectively if it does not resist the training process, but many partially learned goals incentivize an AI to avoid further goal updates. We would like goals to be corrigible, meaning t…