一位 Mastodon 用户报告称,尽管其代理的技能集几乎没有变化,但其代理的性能却显著下降。这种下降归因于底层模型更新,导致人们对 AI 系统中隐藏的变化感到不舒服。 AI
影响 凸显了意外的 AI 模型更新可能对用户体验和系统可靠性产生负面影响的可能性。
排序理由 社交媒体平台上关于 AI 性能下降个人经历的用户生成内容。
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
一位 Mastodon 用户报告称,尽管其代理的技能集几乎没有变化,但其代理的性能却显著下降。这种下降归因于底层模型更新,导致人们对 AI 系统中隐藏的变化感到不舒服。 AI
影响 凸显了意外的 AI 模型更新可能对用户体验和系统可靠性产生负面影响的可能性。
排序理由 社交媒体平台上关于 AI 性能下降个人经历的用户生成内容。
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
完整方法见我们的编辑标准。
My agent eval suddenly got much worse. The skill had barely changed, but the model behind the alias had. That led to a more uncomfortable discovery: sometimes the LLM judge was noisier than the agent being tested. On one regrade of 15 stored failures, the same judge confirmed onl…