加州大学伯克利分校研究人员开发的新基准测试显示,领先的AI模型在实际应用方面表现不佳,得分低于25%。OpenAI的GPT-5.5通过率为24%,得分最高,紧随其后的是Anthropic的Claude Fable 5,通过率为22%。Google Gemini、DeepSeek和Grok等其他知名模型在从音频处理到理论物理的任务上的得分均低于16%。 AI
影响 凸显了当前AI在实际任务能力方面的显著局限性,表明理论性能与实际应用之间存在差距。
排序理由 该集群报告了一项新的基准测试及其结果,这是一项大学的研究成果。
在 Mastodon — sigmoid.social 阅读 →
- Anthropic
- ClaudeFable5
- DeepSeek
- GoogleGemini
- GPT55
- Grok
- Mythos5
- OpenAI
- STANFORD
- University of California, Berkeley
- Claude Fable 5
- Google Gemini
- GPT-5.5
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →