PulseAugur
实时 05:42:27
实体 mini-SWE-agent

mini-SWE-agent

PulseAugur coverage of mini-SWE-agent — every cluster mentioning mini-SWE-agent across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_189799 ·

    Mini-SWE-agent 在调试基准测试中表现出潜力,使用的 token 比 GPT-5.6 少

    一位用户进行了一项基准测试,将 mini-swe-agent 与 GPT-5.6 "Sol" 进行了调试任务的比较。mini-swe-agent,特别是当使用 "bash + linear history" 设置时,其通过率显著提高,并且使用的 token 比 Codex CLI High 少。尽管承认单个基准测试切片的局限性,但用户认为这些结果对于日常 bug 修复很有希望,并寻求社区对该工具的使用经验。

  2. RESEARCH · CL_96671 ·

    新的调优方法提升了LLM编码代理的性能

    研究人员开发了一种名为探测与精炼调优的新方法,以提高大型语言模型(LLM)编码代理的性能。该技术侧重于增强指导代理访问代码存储库相关部分的引导文件。通过使用合成的bug修复探测,调优过程会迭代地诊断和精炼这些引导文件,从而显著提高代理解决编码任务的能力。这种改进源于对相关文件更好的覆盖率,而不是代码更改本身的精度提高。

  3. RESEARCH · CL_77154 ·

    新基准显示 AI 代理在研究细节方面存在困难

    引入了一个名为 AARR 的新基准系列,用于评估高级 AI 代理的研究能力。首个迭代 AARRI-Bench 测试了代理在需要专业性、彻底性和细微推理方面的任务,这些方面通常是当前系统所忽略的。实验表明,即使是表现最好的代理 Mini-SWE-Agent(使用 Claude Opus 4.7),成功率也仅为 68.3%,这凸显了 AI 需要更好地模仿人类研究行为。