OpenAI 发现其先前曾认可为被污染的 SWE-bench 基准测试的替代品的 SWE-bench Pro 编码基准测试存在严重的可靠性问题。这项新分析表明,SWE-bench Pro 本身可能不是衡量 AI 编码性能的可靠指标。另外,一篇新的 arXiv 预印本提出将神经网络训练重构为最优控制问题,旨在误差最高处插入层数,但目前支持该方法的证据有限。 AI
影响 对 AI 评估基准测试的批评和新颖的训练方法突显了在可靠评估和改进 AI 能力方面持续存在的挑战。
排序理由 该集群包含一篇研究论文和一个对基准测试的批评,符合研究类别。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →