Anthropic 开发了一个基于 Claude Opus 4.8 的自动化对齐研究员系统,命名为 AAR。该系统能够自主搜索研究论文、提出解决方案、生成数据并训练模型来解决 AI 安全问题。在测试中,AAR 在 10 个不同的安全挑战中成功改进了模型,在有效性方面优于人类研究员,并显著降低了成本,其每小时运营成本为 4 美元,而人类研究员为 150 美元。此外,一个能力较弱的版本 Claude Sonnet 5 被用于训练更高级版本的 Claude Opus 4.8,展示了一种 AI 自我改进的形式。 AI
影响 这项研究表明,AI 系统可以显著加速 AI 安全的开发,并可能实现 AI 自我改进,从而影响 AI 进步的速度和人类研究员的角色。
排序理由 研究论文,详细介绍了 AI 系统进行 AI 安全研究和改进模型的能力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →