研究人员开发了一种新颖的在线学习算法,显著提高了人类反馈强化学习(RLHF)的数据效率。该算法在获得选择数据后会增量更新奖励模型和语言模型,利用了肯定提示、用于不确定性建模的认知神经网络以及信息导向探索等功能。在Gemma大型语言模型上进行测试时,该算法使用不到20,000个标签即可达到与使用200,000个标签训练的离线RLHF相当的性能,数据效率提高了十倍以上。研究人员预计,他们的方法在更大的数据集上可以实现1000倍的数据效率提升。 AI
影响 该算法通过提高RLHF中的数据效率,可以大幅降低训练强大AI模型的成本和时间。
排序理由 详细介绍改进RLHF数据效率新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →