研究人员开发了一种新的C++推理引擎,使用ONNX Runtime进行人类反馈强化学习(RLHF)管道中的奖励模型评分。该引擎在CPU和GPU上与PyTorch eager模式、torch.compile和FastAPI进行了基准测试。C++引擎在CPU上表现出卓越的性能,优于所有基线,而在GPU上,torch.compile取得了更快的速度。研究还强调,批处理策略,特别是长度感知分桶,对吞吐量有显著影响,尤其是在GPU上。 AI
影响 优化奖励模型评分可以加速RLHF训练,可能导致更快地开发出更强大的AI代理。
排序理由 该集群包含一篇研究论文,详细介绍了RLHF推理运行时的系统研究。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- central processing unit
- CPP
- FastAPI
- graphics processing unit
- ONNX Runtime
- PyTorch
- reinforcement learning from human feedback
- torch.compile
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →