FrontierSWE
PulseAugur coverage of FrontierSWE — every cluster mentioning FrontierSWE across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Bespoke Labs 寻求研究员开发长期代理基准
Bespoke Labs 正在寻找一名研究员,为长期代理任务开发和评估强化学习环境和基准。该职位要求具备多步推理代理的实践经验,特别是提及对 SWE-bench 和 Gymnasium 等环境的贡献。该职位为远程合同,申请将根据长期代理工作的具体证据进行筛选。
-
中国 Z.ai 发布低成本 GLM 5.2,挑战美国 AI 模型主导地位
总部位于北京的 Z.ai 实验室发布了 GLM 5.2,这是一款开放权重 AI 模型,其成本远低于领先的美国前沿模型。虽然 GLM 5.2 的 API 成本仅为 Anthropic 的 Opus 4.8 和 Fable 等模型的一小部分,但其在编码和代理基准测试中的表现正在缩小与美国竞争对手的差距。这一发展挑战了一些 AI 工程师的成本节约习惯,并引发了美国 AI 公司对其保持竞争优势的担忧,尽管开放权重性质允许自托管以缓解数据隐私问题。
-
Moonshot AI 发布 Kimi K3,拥有 1M 上下文、开源权重和有竞争力的价格
Moonshot AI 发布了 Kimi K3,这是一个拥有约 2.8 万亿参数和 100 万 token 上下文窗口的开源权重模型。该模型在 Terminal-Bench 2.0、FrontierSWE 和 GPQA Diamond 等基准测试中取得了强劲的性能。值得注意的是,在 Arena 文本任务盲测中,Kimi K3 的排名高于 Claude 3 Opus,并在前端编码能力方面领先,超越了所有美国前沿模型。此次发布还具有每百万…
-
智谱AI发布拥有100万上下文窗口的GLM-5.2,挑战顶级闭源模型
智谱AI发布了GLM-5.2,这是一个拥有100万token上下文窗口的744B参数混合专家模型,并采用MIT许可协议发布权重。该模型在BenchLM排行榜上名列前茅,并在编码基准测试中表现强劲,使其成为可与Claude Opus 4.8和GPT-5.5等闭源模型相媲美的领先开源选项。然而,文章强调,尽管扩展的上下文窗口功能强大,但如果管理不当,可能会导致API成本显著增加,并敦促开发人员优化token使用。
-
中国的GLM-5.2在编码基准测试中挑战GPT-5.5和Claude Opus
智谱AI的GLM-5.2是中国的一款前沿模型,据报道在编码基准测试中表现强劲,超越了OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7。在FrontierSWE基准测试中,GLM-5.2得分74.4%,略微落后于Claude Opus 4.8,但优于GPT-5.5。该模型在Terminal-Bench 2.1上也显示出显著的进步,并且在编码能力上与领先的专有模型相当,同时还提供了开源选项。
-
Z.ai发布GLM-5.2,为长上下文AI设定新的开源基准
Z.ai发布了GLM-5.2,一个具有100万token上下文窗口的开源语言模型,使其成为长时任务和编码基准的有力竞争者。该模型采用改进的架构,并引入了IndexShare以降低计算成本并增强推测解码。在各种编码和智能体基准测试中,GLM-5.2展示了与Anthropic的Opus系列和OpenAI的GPT-5.5等领先的专有模型相媲美的性能,成为同类产品中性能最佳的开源模型。