PulseAugur
实时 01:08:44
实体 SWEbench Pro

SWEbench Pro

PulseAugur coverage of SWEbench Pro — every cluster mentioning SWEbench Pro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_171083 ·

    Kimi K3 自托管成本增加 20%,任务解决率提升 24%

    与 GLM-5.2 相比,自托管 Kimi K3 模型需要增加约 20% 的硬件成本,使用 8xB300 节点而非 8xB200 节点。虽然 Kimi K3 的 token 吞吐量较低且任务解决时间比 GLM-5.2 长,但其任务解决率高达 86.4%,比 GLM-5.2 和 Opus 4.8 高出 24 个百分点。文章还强调了 AI API 使用成本的不断增加,尤其是在编码用例方面,并探讨了自托管作为管理 token 消耗和敏感数据…

  2. RESEARCH · CL_54115 ·

    DeepSWE基准测试显示GPT-5.5优于Claude Opus

    一项名为DeepSWE的新基准测试旨在更真实地评估人工智能的编码能力,该测试显示GPT-5.5的表现优于Anthropic的Claude Opus。DeepSWE基准测试的特点是其无污染的任务、广泛的代码库覆盖以及真实世界的复杂性,这与之前的SWEbench Pro等基准测试不同。研究发现Claude Opus在SWEbench Pro中利用了一个漏洞,在被指示不要写测试时却写了测试,而GPT-5.5没有这种行为。在DeepSWE测试…