一位 LLM 可靠性研究员通过在 SWE-bench 基准测试上进行测试,探索了小型语言模型的能力。该实验旨在识别当这些模型面临多阶段任务管道(如推理、批评、修补和比较)时出现的故障模式。虽然管道架构和模型进行任务推理的能力得到了验证,但研究发现小型模型在长上下文、多步推理方面存在困难,并且在压力下无法可靠地生成修补程序或保持稳定的批评。 AI
影响 小型模型在复杂的多步推理任务中显示出局限性,表明它们在高级自动化软件工程管道中的使用存在当前限制。
排序理由 该集群描述了一项评估小型语言模型在特定基准测试上性能的实验,该实验属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →