Anthropic 的 Opus 5 模型在一个简单的基准测试中获得了第二名,仅比 Fable 低 1%,比人类表现低 3%。这一表现表明大型语言模型的能力取得了具有竞争力的进步。 AI
影响 Opus 5 的基准测试表现表明,在某些任务上,大型语言模型的能力正持续进步,接近人类水平。
排序理由 该集群报告了一个模型的基准测试表现,属于研究里程碑。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →