Anthropic 的 Claude Haiku 5.5 在多项基准测试中表现强劲,包括 OSWorld 2.1、GDPval-AA v2.1、FrontierCode 1.1 和 Terminal-Bench。该模型的强大能力在关于 AI 开发和编码的讨论中备受关注。 AI
影响 在编码和通用基准测试中展现出强大的竞争力,可能影响未来 LLM 的发展。
排序理由 Frontier-lab 模型发布,附带系统卡 [lever_c_demoted from frontier_release: ic=2 ai=1.0]
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →