PulseAugur
实时 08:38:39
实体 Vikranth Dwaracherla

Vikranth Dwaracherla

PulseAugur coverage of Vikranth Dwaracherla — every cluster mentioning Vikranth Dwaracherla across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_216027 ·

    新的RLHF算法使用Gemma LLM实现了10倍数据效率提升

    研究人员开发了一种新颖的在线学习算法,显著提高了人类反馈强化学习(RLHF)的数据效率。该算法在获得选择数据后会增量更新奖励模型和语言模型,利用了肯定提示、用于不确定性建模的认知神经网络以及信息导向探索等功能。在Gemma大型语言模型上进行测试时,该算法使用不到20,000个标签即可达到与使用200,000个标签训练的离线RLHF相当的性能,数据效率提高了十倍以上。研究人员预计,他们的方法在更大的数据集上可以实现1000倍的数据效率提升。