研究人员开发了一个名为 Test Cases Scaling (TCS) 的新颖两阶段强化学习框架,用于自动为代码生成模型生成高质量的测试用例。该框架旨在创建既可靠又具辨别力的测试,作为反例来识别求解器的故障模式。通过两阶段训练测试生成器,首先使其与参考解决方案保持一致,然后生成对抗性反例,TCS 在 TACO 和 LiveCodeBench 等基准测试中显示出 pass@1 率和推理时答案选择的改进。 AI
影响 这项研究通过实现更有效的对抗性测试用例生成,有可能提高代码生成模型的评估和鲁棒性。
排序理由 该集群包含一篇详细介绍代码大模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →