谷歌的 Gemini 4 Argon 模型在多项基准测试中表现出色,在许多类别中均优于 OpenAI 的 GPT-6 Astra 以及 Anthropic 的 Claude Opus 5.5 和 Claude Fable 5.1,尤其是在软件工程、法律和金融任务方面。尽管 Gemini 4 Argon 的基准测试结果强劲,但目前尚未广泛提供,仅限于谷歌的合作伙伴。Argon 的定价具有竞争力,尤其是在推出初期,使其比 GPT-6 Astra 便宜得多。 AI
影响 为长上下文推理和专业任务设定了新的基准,可能影响未来的模型开发和定价策略。
排序理由 前沿实验室模型发布,附带系统卡和基准测试数据。
在 Mastodon — mastodon.social 阅读 →
- Anthropic
- Claude Fable 5.1
- Claude Opus 5.5
- CWE-bench v1
- DeepSWE v1.1
- Gemini 4 Argon
- Google DeepMind
- GPT-6 Astra
- Harvey's Legal Agent Benchmark
- OpenAI
- Vals Index
AI 生成摘要 · Google Gemini · 来自 8 个来源。 我们如何撰写摘要 →