一个名为 Livenerf 的开源项目已被开发出来,用于独立追踪和衡量 Anthropic 的 Opus 5.5 模型随时间推移的性能变化。该项目使用 SWE-bench 和 SciCode 等既定基准,并采用标准化的科学方法来检测模型发布后可能出现的“削弱”或性能下降。虽然目前正在进行数据收集,但在模型发布后约二十天才能得出关于性能变化的明确结论,当前数据将有助于基线评估。 AI
影响 提供了一个社区驱动的工具,用于提高 AI 模型性能变化的透明度,可能影响用户信任和开发者问责制。
排序理由 该集群讨论了一个使用基准来评估现有 AI 模型随时间推移性能的开源项目,这属于研究范畴。
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →