研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修复和跨语言问题解决。 AI
影响 增强了小型语言模型在复杂软件工程任务中的能力,可能降低 AI 辅助开发的门槛。
排序理由 这是一篇详细介绍软件工程任务新方法和模型微调的研究论文。
在 Hugging Face Daily Papers 阅读 →
- Deepsweg
- FeatBench
- GLM-5.2
- NL2Repo-Bench
- ProgramBench
- Qwen3.6-27B
- RepoZero-C2Rust
- SWE-bench Multilingual
- SWE Bench Pro
- SWE-bench Verified
- Claude Opus 4.7
- DeepSeek V4 Pro
- GLM-5.1
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →