Anthropic发布了Claude Opus 5.5,该模型在视觉任务上表现出色,并在SimpleBench测试中领先。该新模型在Terminal-Bench-Science基准测试中的推理能力也很强,可与GPT-6 Astra相媲美。与此同时,OpenAI的GPT-6系列,包括Astra、Sol和Luna,在NetHack、Code Arena和DOOM agent任务等领域展现出令人印象深刻的性能。其他值得注意的发布包括具有大上下文窗口的Gemini 3.8 Flash,以及开源且经济高效的小米全模态MiMo-V2.6-Pro。 AI
影响 在视觉和推理基准测试中设定了新的SOTA(state-of-the-art),加剧了顶级AI实验室之间的竞争。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c] 从 frontier_release 降级:ic=1 ai=1.0
- Anthropic
- Claude Code
- Codex
- Databricks
- Gemini 3.8 Flash
- Google Cloud Platform
- GPT-6
- GPT-6 Astra
- GPT-6 Luna
- GPT-6 Sol
- Meta*
- Muse Spark 1.3
- Opus 5.5
- SimpleBench
- Terminal-Bench-Science
- Xiaomi MiMo-V2.6-Pro
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →