实体
mini-SWE-agent
mini-SWE-agent
PulseAugur coverage of mini-SWE-agent — every cluster mentioning mini-SWE-agent across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Mini-SWE-agent 在调试基准测试中表现出潜力,使用的 token 比 GPT-5.6 少
一位用户进行了一项基准测试,将 mini-swe-agent 与 GPT-5.6 "Sol" 进行了调试任务的比较。mini-swe-agent,特别是当使用 "bash + linear history" 设置时,其通过率显著提高,并且使用的 token 比 Codex CLI High 少。尽管承认单个基准测试切片的局限性,但用户认为这些结果对于日常 bug 修复很有希望,并寻求社区对该工具的使用经验。
-
新的调优方法提升了LLM编码代理的性能
研究人员开发了一种名为探测与精炼调优的新方法,以提高大型语言模型(LLM)编码代理的性能。该技术侧重于增强指导代理访问代码存储库相关部分的引导文件。通过使用合成的bug修复探测,调优过程会迭代地诊断和精炼这些引导文件,从而显著提高代理解决编码任务的能力。这种改进源于对相关文件更好的覆盖率,而不是代码更改本身的精度提高。
-
新基准显示 AI 代理在研究细节方面存在困难
引入了一个名为 AARR 的新基准系列,用于评估高级 AI 代理的研究能力。首个迭代 AARRI-Bench 测试了代理在需要专业性、彻底性和细微推理方面的任务,这些方面通常是当前系统所忽略的。实验表明,即使是表现最好的代理 Mini-SWE-Agent(使用 Claude Opus 4.7),成功率也仅为 68.3%,这凸显了 AI 需要更好地模仿人类研究行为。