Anthropic 的 Claude Haiku 5.5 在 OSWorld 2.1、GDPval-AA v2.1、FrontierCode 1.1 和 Terminal-Bench 等多项基准测试中表现强劲。该模型的强大能力正在 AI 开发和编码的讨论中得到突出展示。 AI
影响 在编码和通用基准测试中展现出竞争力,可能影响未来 LLM 的发展。
排序理由 Frontier-lab 模型发布,带有系统卡 [lever_c_demoted from frontier_release: ic=2 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →