SWE-Marathon
PulseAugur coverage of SWE-Marathon — every cluster mentioning SWE-Marathon across labs, papers, and developer communities, ranked by signal.
-
xAI 发布 Grok 4.5,目标是程序员和办公室任务
xAI 推出了 Grok 4.5,这是其迄今为止最先进的模型,专为编程、代理任务和知识工作而设计。Grok 4.5 在 NVIDIA GB300 GPU 上使用 Cursor 进行训练,在编码基准测试中表现强劲,在 DeepSWE 1.0 上达到 62%,并在 SWE Marathon 测试中表现出色。该模型优先考虑速度和效率,以每秒 80 个 token 的速度处理,并且使用的 token 数量远少于 Opus 4.8,这反映在其具…
-
AI模型在马拉松式任务中挣扎,揭示基准测试局限性 · 跟踪到1个来源
新的基准测试揭示了AI模型在短期、单次会话任务上的表现与处理长达数小时操作的能力之间存在显著差距。虽然GLM-5.2和GPT-5.5等模型在SWE-bench等基准测试中表现出色,但在SWE-Marathon等需要持续数小时和数百万个token才能完成的任务上,它们的成功率急剧下降。这种差异凸显了当前基准测试可能无法准确反映现实世界代理的能力,而真正的挑战在于构建具有有效自我验证和恢复机制的强大系统,而不仅仅是关注模型权重。
-
智谱AI发布拥有100万上下文窗口的GLM-5.2,挑战顶级闭源模型
智谱AI发布了GLM-5.2,这是一个拥有100万token上下文窗口的744B参数混合专家模型,并采用MIT许可协议发布权重。该模型在BenchLM排行榜上名列前茅,并在编码基准测试中表现强劲,使其成为可与Claude Opus 4.8和GPT-5.5等闭源模型相媲美的领先开源选项。然而,文章强调,尽管扩展的上下文窗口功能强大,但如果管理不当,可能会导致API成本显著增加,并敦促开发人员优化token使用。
-
Z.ai发布GLM-5.2,为长上下文AI设定新的开源基准
Z.ai发布了GLM-5.2,一个具有100万token上下文窗口的开源语言模型,使其成为长时任务和编码基准的有力竞争者。该模型采用改进的架构,并引入了IndexShare以降低计算成本并增强推测解码。在各种编码和智能体基准测试中,GLM-5.2展示了与Anthropic的Opus系列和OpenAI的GPT-5.5等领先的专有模型相媲美的性能,成为同类产品中性能最佳的开源模型。