Atlassian 报告称其 Rovo Dev AI 审查器取得了显著改进,将拉取请求(pull request)周期时间内部缩短了高达 45%,外部贡献缩短了 32%。另外,Specific Labs 推出了 Real-SWE,这是一个面向企业的代码基准测试,用于测试前沿模型在私有代码库上的表现。Real-SWE 的初步发现表明,Claude Code 和 Codex CLI 等模型在此专业基准测试上的表现不如预期。 AI
影响 AI 代码审查工具显示出可衡量的效率提升,而新的基准测试突显了在私有企业代码上对模型进行专门评估的必要性。
排序理由 该集群讨论了一个产品功能改进(Rovo Dev AI)和一个新基准测试工具(Real-SWE)的发布。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →