SWE-QA
PulseAugur coverage of SWE-QA — every cluster mentioning SWE-QA across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现,语义搜索在代码问答方面优于深度代理搜索
一项新近发表在arXiv上的研究,调查了大型代码仓库中两种主要的问答方法:语义搜索和深度代理搜索。研究人员发现,语义搜索在代码问答方面优于深度代理搜索,正确回答率达到65.2%,而深度代理搜索为46.2%,且成本不到其一半。研究指出,尽管深度代理搜索是保护代理免受上下文污染的首选设计,但它引入了一种显著的失败模式,即子代理会自信地提供错误答案。
-
微软发布 FastContext 以提高 LLM 编码代理效率
微软发布了 FastContext,这是一个开源的仓库探索子代理,旨在提高 LLM 编码代理的性能。该工具将仓库探索和任务解决的角色分开,允许主编码代理将只读工具调用委托给 FastContext。该子代理返回紧凑的文件路径和行范围,在 SWE-bench Pro 等基准测试中,端到端准确性显著提高,令牌使用量减少高达 60.3%。
-
新的LaMR框架为LLM代理修剪代码上下文
研究人员开发了一个名为LaMR(Latent Multi-Rubric)的新框架,以提高LLM驱动的代码代理的效率。目前的代理经常在无关的代码片段上浪费令牌预算,但LaMR通过将代码相关性分解为两个不同的维度来解决这个问题:语义证据和依赖支持。这种方法可以更精确地修剪上下文,从而在令牌使用量上节省大量成本,并在许多情况下提高代码任务的性能。实验表明,LaMR经常能匹配或超越未修剪的基线,节省高达31%的令牌并提高精确匹配分数。
-
SWE-QA 基准测试 LLM 回答代码仓库级别的问题
研究人员推出了 SWE-QA,这是一个旨在评估语言模型回答有关整个软件仓库问题的能力的新基准。该基准通过关注需要理解多文件依赖关系和软件架构的复杂、真实代码场景,解决了先前数据集的局限性。SWE-QA 包含 576 个源自 GitHub issue 的问答对,并已用于测试多个大型语言模型,其中提出的 agentic 框架显示出潜力。