PulseAugur
实时 00:45:32
English(EN) Quantilized debate and consultancy in image environments: protocol design lessons for scalable oversight experiments

AI安全辩论协议得到增强,以支持可扩展的监督实验

研究人员探索了一种在图像环境中进行可扩展监督实验的协议,该协议建立在先前“AI安全通过辩论”工作的基础上。该研究比较了“辩论”和“咨询”方法,其中代理选择图像单元供裁判查看。主要发现表明,辩论可以作为一种正则化器来防止奖励黑客攻击,而咨询的准确性会随着更强大的代理而下降。研究还对辩论实验提出了改进建议,例如训练裁判精确生产数量并允许辩论者提出相同答案。 AI

影响 提出改进的方法来训练和评估复杂环境中的AI系统,可能增强AI安全研究。

排序理由 该集群描述了一篇研究论文,其中详细介绍了一种用于AI安全实验的新协议。[lever_c_demoted from research: ic=1 ai=1.0]

在 LessWrong (AI tag) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AI安全辩论协议得到增强,以支持可扩展的监督实验

报道来源 [1]

  1. LessWrong (AI tag) TIER_1 English(EN) · emanuelr ·

    量化图像环境中的辩论与咨询:可扩展监督实验的协议设计经验

    <h2><span>TL;DR</span></h2><p><span>We present an improved version of the sparse-pixel experiment from </span><a href="https://arxiv.org/abs/1805.00899"><i><span>AI Safety via Debate</span></i></a><span> (2018), where a weak judge classifies an image from 4 of its 36 cells and po…