Anthropic 发布了 Claude 3.5 Sonnet,这是一款新的中端模型,在推理和编码基准测试中超越了其前旗舰 Claude 3 Opus。此次发布显著提高了成本效益比,使 Sonnet 3.5 成为生产环境中 AI 应用的推荐选择,尤其是在涉及智能体编码任务时。该模型比其前代产品更快、更便宜、更智能,在视觉能力和图像文本转录方面取得了显著进步。 AI
影响 在研究生水平的推理和编码基准测试中设定了新的 SOTA(state-of-the-art),使其成为构建者和智能体系统的默认选择。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Amazon Bedrock
- Anthropic
- Claude 3.5 Sonnet
- Claude 3 Opus
- Google Cloud
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- HumanEval
- Massive Multitask Language Understanding
- Messages API
- Vertex AI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →