一篇新研究论文提出,通过关注每轮分布而非平均性能来训练强化学习代理以展现道德行为。该研究在Craftax基准测试中比较了四种训练方法,发现一种在预期标量回报(ESR)标准下优化每轮非补偿效用的方法最有效。与允许违规平均化或在最坏情况下超出预算的其他方法不同,这种ESR方法几乎确保了在每一轮中都满足规定的违规预算。 AI
影响 提出了一种新的AI代理训练范式,以确保道德行为的一致性,而不是平均性。
排序理由 详细介绍一种新颖的训练道德AI代理方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Craftax
- DagsHub
- ESR
- Expected Scalarized Returns
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- Lagrange function
- reinforcement learning
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →