PulseAugur
实时 18:18:11
English(EN) Post 1 — SWE‑Bench Reliability Series

大型语言模型难以处理复杂的 GitHub 问题,仅解决 1.96%

关于 SWE-bench 可靠性的新系列文章指出,包括专有模型和经过微调的版本(如 SWE-Llama)在内的当前最先进的大型语言模型,只能解决真实世界 GitHub 问题的一小部分(1.96%)。当问题需要多文件推理或系统级理解时,而不仅仅是简单的模式匹配,就会出现这种能力差距。作者计划开发一个混合模型来应对当前模型表现不佳的中等复杂度的软件工程任务。 AI

影响 强调了大型语言模型在复杂推理任务中的当前局限性,表明它们在处理真实世界软件工程问题方面存在巨大差距。

排序理由 该条目讨论了特定任务(SWE-bench)的基准测试结果和模型能力,并引用了一篇 arXiv 论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

大型语言模型难以处理复杂的 GitHub 问题,仅解决 1.96%

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Agentic Drifter ·

    Post 1 — SWE‑Bench Reliability Series

    <p>𝗧𝗵𝗲 𝟭.𝟵𝟲% 𝗚𝗮𝗽 - 𝗧𝗵𝗲 𝗟𝗶𝗻𝗲 𝗧𝗵𝗮𝘁 𝗗𝗲𝗳𝗶𝗻𝗲𝘀 𝘁𝗵𝗲 𝗙𝗿𝗼𝗻𝘁𝗶𝗲𝗿</p> <p>LLMs look impressive until you ask them to solve something real – the moment a problem requires reasoning instead of pattern‑matching, the 1.96% ceiling shows up.</p> <p>SWE-bench: Can Language Models Resolve Real-World…