引入了两个新的基准测试SWE-Together和SWE-Interact,用于在更真实、交互式和多轮的用户会话中评估编码代理。与一次性提供完整任务描述的静态基准测试不同,这些新框架模拟用户交互,逐步揭示需求并提供反馈。实验表明,在单轮任务上的强劲表现并不总是能转化为多轮场景,像Opus 4.8和GPT 5.5这样的顶级模型仍然存在忘记需求或犯技术性错误等问题。 AI
影响 这些基准测试将推动更强大的AI编码助手的发展,使其能够处理复杂的交互式软件工程任务。
排序理由 两篇学术论文介绍了用于评估AI编码代理的新基准测试。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- GPT 5.5
- Hugging Face
- Opus 4.8
- ScienceCast
- SWE-Interact
- SWE-Together
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →