SWE-bench Lite
PulseAugur coverage of SWE-bench Lite — every cluster mentioning SWE-bench Lite across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Twin Agent 设计模式增强 LLM 安全性,抵御提示注入攻击
研究人员推出了一种新颖的大型语言模型(LLM)代理设计模式 Twin Agent,旨在增强其抵御提示注入攻击的安全性。该模式采用两个代理:一个处理不可信信息的 Explore Agent 和一个执行特权操作的 Safe Agent。通过压缩代理之间的信息流,Twin Agent 旨在改善安全-效用权衡,该模式已在软件工程和多工具交互任务上得到验证。
-
BLAgent框架通过代理式RAG增强文件级错误定位
研究人员开发了BLAgent,一个新颖的代理式检索增强生成(RAG)框架,旨在改进软件维护中的文件级错误定位。BLAgent集成了代码结构感知编码、双视角查询转换和两阶段代理式重排序过程。该方法在本地化准确性和计算成本之间取得了平衡,在使用开源模型时,在SWE-bench Lite上实现了超过78%的Top-1准确率,在使用闭源模型时,准确率超过86%,同时比现有方法更具成本效益。当集成到自动化程序修复框架中时,BLAgent已证明端…
-
新的 AI 内存层 ContextSniper 减少了代码修复的令牌使用量
研究人员开发了 ContextSniper,这是 AntTrail AI 代理的一种新的令牌高效内存层,旨在改进面向代码库级别的程序修复。ContextSniper 精确选择和排序代码及运行时证据,过滤掉不相关信息以减少令牌使用量。在 SWE-bench Lite 上的评估显示,OpenClaw 和 Claude Code 代理的令牌使用量和记录成本均显著降低,但提交的解决方案率略有下降。
-
新的SHERLOC框架提高了LLM代码修复的效率和准确性
研究人员开发了SHERLOC,一个旨在提高大型语言模型(LLM)代理在代码修复任务中的效率和准确性的新框架。这个无需训练的框架利用具有专门的存储库工具和自我恢复能力的推理LLM,无需进行微调或多代理编排。SHERLOC实现了最先进的定位性能,在各种模型规模上均优于现有方法。当集成到修复代理中时,SHERLOC显著提高了解决率,同时减少了定位时间和令牌使用量。
-
多智能体 LLM 系统 Phoenix 自动化 GitHub 问题解决
研究人员开发了 Phoenix,一个旨在自动解决 GitHub 问题多智能体 LLM 系统。该系统利用六个专业智能体,包括规划者、编码者和测试者,来管理从问题分类到创建 pull request 的整个过程。Phoenix 包含七层安全控制和一种基线感知测试策略,在精选的 SWE-bench Lite 切片上实现了 75% 的预言家解决率,并在真实问题试点研究中保持了 100% 的正确性保留。
-
Phoenix LLM系统通过安全控制自动化GitHub问题解决
一个名为Phoenix的新型多智能体LLM系统已被开发出来,用于自动化GitHub问题的解决,从初步分类到创建拉取请求。该系统包含七层安全控制和一个基线感知测试策略,以确保可靠性。Phoenix将任务分解为六个专业智能体,包括规划者、复现者、编码者、测试者、故障分析师和一个PR智能体,所有这些都由一个Webhook状态机协调。该系统在精选的SWE-bench Lite数据集上展示了75%的Oracle解决率,并在真实世界问题上保持了1…
-
新的Autopilot防火墙可大幅减少LLM代理的虚报
研究人员开发了一种名为Autopilot的新执行模型,旨在防止大型语言模型代理在无人监督的情况下虚报成功。该系统通过将代理状态外部化为有限状态机来充当防火墙,确保任何完成声明都与特定网关的已验证执行相关联。在测试中,与Reflexion和StateFlow等现有方法相比,Autopilot显著降低了虚报率,尤其是在具有挑战性的软件开发任务上。
-
AI代理的目标导向性和状态绑定评估
两篇新研究论文探讨了语言代理的内部运作和评估。第一篇论文引入了一个“因果状态绑定”框架,以评估代理的行为是否真正由相关的内部状态驱动,而非表面线索,并在SWE-bench Lite等基准测试中展示了性能提升。第二篇论文提出了一种结合行为分析和可解释性技术的方法来评估代理的目标导向性,发现代理在内部编码了空间地图和行动计划,但需要超越单纯行为指标的内省。
-
ARISE工具集增强AI代理的代码故障定位和修复能力
研究人员开发了ARISE,一个旨在提高AI代理在软件故障定位和修复方面准确性的新系统。ARISE通过提供包含数据流信息的详细程序图来增强大型语言模型,使代理能够更精确地追踪变量使用。在SWE-bench Lite上的评估表明,与现有基线相比,故障定位和修复成功率有了显著提高。