PulseAugur
实时 09:03:43
English(EN) How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

新的C++引擎加速了CPU上的RLHF奖励评分

研究人员开发了一种新的C++推理引擎,使用ONNX Runtime进行人类反馈强化学习(RLHF)管道中的奖励模型评分。该引擎在CPU和GPU上与PyTorch eager模式、torch.compile和FastAPI进行了基准测试。C++引擎在CPU上表现出卓越的性能,优于所有基线,而在GPU上,torch.compile取得了更快的速度。研究还强调,批处理策略,特别是长度感知分桶,对吞吐量有显著影响,尤其是在GPU上。 AI

影响 优化奖励模型评分可以加速RLHF训练,可能导致更快地开发出更强大的AI代理。

排序理由 该集群包含一篇研究论文,详细介绍了RLHF推理运行时的系统研究。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的C++引擎加速了CPU上的RLHF奖励评分

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    奖励模型能跑多快?一项关于RLHF的C++和PyTorch推理运行时的系统研究

    In RLHF pipelines, reward scoring blocks policy updates. Slow scoring bottlenecks the entire loop, since no update runs until every rollout gets a score. And yet most setups just default to PyTorch eager mode or torch.compile, no one checks if that's actually fastest. Scoring its…