研究人员开发了一种名为基于验证器的强化微调(RLVR)的新颖方法,用于将开放权重推理模型适配到热能存储控制等复杂任务中。该技术使用动态规划生成可验证的奖励,然后用于微调GPT-5等模型。研究表明,RLVR在模拟办公楼的热能存储系统中显著减少了排放,使性能接近最优水平。研究结果表明,推理时的推理能力对于此类控制任务至关重要,而RLVR方法有望在能源管理领域得到更广泛的应用。 AI
影响 这项研究展示了一种将LLM适配到复杂控制任务的新颖方法,有望提高建筑和其他系统的能源效率。
排序理由 该集群包含一篇学术论文,详细介绍了一种微调推理模型的新方法。
- arXiv
- dynamic programming
- GPT-4o
- GPT-5
- model predictive control
- Reasoning Models
- Reinforcement Fine-Tuning
- reinforcement learning
- RLVR
- thermal energy storage
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →