PulseAugur
实时 18:45:12
实体 SlopCodeBench

SlopCodeBench

PulseAugur coverage of SlopCodeBench — every cluster mentioning SlopCodeBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_210015 ·

    GLM-5.3 和 Qwen 3.8 27B 模型在 SlopCodeBench 上进行测试

    GLM-5.3 和 Qwen 3.8 27B 模型在 SlopCodeBench 上的新基准测试结果已发布。GLM-5.3 在一个包含 17 个检查点的子集上获得 8/17 的分数,在另一个包含 30 个检查点的子集上获得 10/30 的分数,后者与 Fable 5 和 GPT-5.6 Sol 并列。Qwen 3.8 27B 的表现不那么令人印象深刻,在 17 个检查点的子集上得分为 3/17,在 30 个检查点的子集上得分为 4/3…

  2. SIGNIFICANT · CL_199218 ·

    Claude Opus 5 因基准测试受赞扬,因冗长性受批评

    Anthropic 的 Claude Opus 5 在基准测试有所改进的同时,变得明显更加冗长,并且更难供人类解析。该模型的默认响应更长,包含更多叙述,并且可以超出初始请求扩展任务。这种增加的冗长性,由 Anthropic 在模型发布当天记录,尽管其在智能和回归基准测试中表现强劲,但已导致部分用户信任度下降。用户正在探索变通方法,例如使用 Claude Fable 5 进行规划和 Opus 5 进行执行的分离模型方法来管理输出。

  3. TOOL · CL_175282 ·

    Deepseek V4 Flash 在 SlopCodeBench 上超越 Claude Opus 4.8

    Reddit 的 r/LocalLLaMA 子版块上一位用户分享了 Deepseek V4 Flash 模型在 SlopCodeBench 基准测试中的运行结果。该用户将其性能与 Anthropic 的 Claude Opus 4.8 和未发布的 Claude Opus 5 进行了比较,结果显示 Deepseek V4 Flash 的表现优于 Claude Opus 4.8,但落后于 Claude Opus 5。基准测试结果已发布在 …

  4. TOOL · CL_166586 ·

    Opus 5 在 SlopCodeBench 上进行基准测试,用于编码代理上下文工程

    对 Opus 5 进行了基准测试,评估其在 SlopCodeBench 数据集上的性能。这项专注于编码代理高级上下文工程的评估结果通过 GitHub 存储库共享。Opus 5 在 SlopCodeBench 上的具体性能指标详情可通过此共享资源获取。