FrontierSWE
PulseAugur coverage of FrontierSWE — every cluster mentioning FrontierSWE across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Moonshot推出Kimi K3,拥有2.8万亿参数和100万上下文窗口
Moonshot 推出了其 Kimi K3 模型,这是一个拥有 2.8 万亿参数的混合专家模型,上下文窗口超过 100 万个 token。该模型采用了新的 Kimi Delta Attention 机制,结合了线性注意力和全注意力层以提高效率。虽然 Moonshot 发布了令人印象深刻的演示和供应商运行的基准测试,但文章强调了区分这些与客观可验证的结构事实和独立的第三方信号的重要性。
-
Anthropic 的 Claude Fable 5.1 降低缓存成本但提高每任务价格
Anthropic 发布了 Claude Fable 5.1,其缓存读取成本显著降低了 75%,使得涉及重复上下文的任务成本更低。然而,由于更高的“努力”成本,每任务成本约增加了 20%,这在单次请求、高努力场景中占主导地位。这种定价结构意味着 Fable 5.1 对于长期运行的代理任务可能更经济,但对于高强度的单次请求则更昂贵,具体取决于工作负载。
-
新框架赋能 LLM 代理自主开发和改进软件
研究人员推出 Harness-of-Harness (HoH) 框架,旨在通过使基于 LLM 的编码代理能够持续改进软件来增强自主软件开发能力。HoH 将开发过程结构化为迭代的规划-编码-测试循环,平衡修复与能力增长,并将任务分解为小型、可验证的增量。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 等基准测试中,HoH 表现出显著的性能提升,平均比独立 harness 提高了 52.25%。在…
-
Bespoke Labs 寻求研究员开发长期代理基准
Bespoke Labs 正在寻找一名研究员,为长期代理任务开发和评估强化学习环境和基准。该职位要求具备多步推理代理的实践经验,特别是提及对 SWE-bench 和 Gymnasium 等环境的贡献。该职位为远程合同,申请将根据长期代理工作的具体证据进行筛选。
-
中国 Z.ai 发布低成本 GLM 5.2,挑战美国 AI 模型主导地位
总部位于北京的 Z.ai 实验室发布了 GLM 5.2,这是一款开放权重 AI 模型,其成本远低于领先的美国前沿模型。虽然 GLM 5.2 的 API 成本仅为 Anthropic 的 Opus 4.8 和 Fable 等模型的一小部分,但其在编码和代理基准测试中的表现正在缩小与美国竞争对手的差距。这一发展挑战了一些 AI 工程师的成本节约习惯,并引发了美国 AI 公司对其保持竞争优势的担忧,尽管开放权重性质允许自托管以缓解数据隐私问题。
-
Moonshot AI 发布 Kimi K3,拥有 1M 上下文、开源权重和有竞争力的价格
Moonshot AI 发布了 Kimi K3,这是一个拥有约 2.8 万亿参数和 100 万 token 上下文窗口的开源权重模型。该模型在 Terminal-Bench 2.0、FrontierSWE 和 GPQA Diamond 等基准测试中取得了强劲的性能。值得注意的是,在 Arena 文本任务盲测中,Kimi K3 的排名高于 Claude 3 Opus,并在前端编码能力方面领先,超越了所有美国前沿模型。此次发布还具有每百万…
-
智谱AI发布拥有100万上下文窗口的GLM-5.2,挑战顶级闭源模型
智谱AI发布了GLM-5.2,这是一个拥有100万token上下文窗口的744B参数混合专家模型,并采用MIT许可协议发布权重。该模型在BenchLM排行榜上名列前茅,并在编码基准测试中表现强劲,使其成为可与Claude Opus 4.8和GPT-5.5等闭源模型相媲美的领先开源选项。然而,文章强调,尽管扩展的上下文窗口功能强大,但如果管理不当,可能会导致API成本显著增加,并敦促开发人员优化token使用。
-
中国的GLM-5.2在编码基准测试中挑战GPT-5.5和Claude Opus
智谱AI的GLM-5.2是中国的一款前沿模型,据报道在编码基准测试中表现强劲,超越了OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7。在FrontierSWE基准测试中,GLM-5.2得分74.4%,略微落后于Claude Opus 4.8,但优于GPT-5.5。该模型在Terminal-Bench 2.1上也显示出显著的进步,并且在编码能力上与领先的专有模型相当,同时还提供了开源选项。
-
Z.ai发布GLM-5.2,为长上下文AI设定新的开源基准
Z.ai发布了GLM-5.2,一个具有100万token上下文窗口的开源语言模型,使其成为长时任务和编码基准的有力竞争者。该模型采用改进的架构,并引入了IndexShare以降低计算成本并增强推测解码。在各种编码和智能体基准测试中,GLM-5.2展示了与Anthropic的Opus系列和OpenAI的GPT-5.5等领先的专有模型相媲美的性能,成为同类产品中性能最佳的开源模型。