研究人员开发了一个名为RobustTests的新框架,通过强化学习来提高大型语言模型(LLM)的代码生成能力。该框架通过合成故障代码来识别逻辑差异,并整合验证器代理来过滤测试用例,从而解决了现有测试用例生成中的局限性。此外,它还包含一个密集奖励函数,以减轻合成测试数据的假阴性。实验表明,使用RobustTests对Qwen3-32B模型进行微调,在LiveCodeBench基准测试中性能提高了3%。 AI
影响 通过解决奖励欺骗问题和提高测试用例的全面性,增强了LLM代码生成的准确性。
排序理由 该集群包含一篇研究论文,详细介绍了用于改进LLM代码生成的新框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- CodeContests
- large-language models
- LiveCodeBench
- Qwen3 32B
- Reinforcement Learning from Verifiable Rewards
- RobustTests
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →