PulseAugur
实时 07:51:12
English(EN) Efficient Exploration at Scale

新的RLHF算法使用Gemma LLM实现了10倍数据效率提升

研究人员开发了一种新颖的在线学习算法,显著提高了人类反馈强化学习(RLHF)的数据效率。该算法在获得选择数据后会增量更新奖励模型和语言模型,利用了肯定提示、用于不确定性建模的认知神经网络以及信息导向探索等功能。在Gemma大型语言模型上进行测试时,该算法使用不到20,000个标签即可达到与使用200,000个标签训练的离线RLHF相当的性能,数据效率提高了十倍以上。研究人员预计,他们的方法在更大的数据集上可以实现1000倍的数据效率提升。 AI

影响 该算法通过提高RLHF中的数据效率,可以大幅降低训练强大AI模型的成本和时间。

排序理由 详细介绍改进RLHF数据效率新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RLHF算法使用Gemma LLM实现了10倍数据效率提升

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy ·

    高效大规模探索

    arXiv:2603.17378v2 Announce Type: replace-cross Abstract: We develop an online learning algorithm that dramatically improves the data efficiency of reinforcement learning from human feedback (RLHF). Our algorithm incrementally updates reward and language models as choice data is …