Anthropic 发布了 Claude Sonnet 4.5,该模型拥有 200K token 的上下文窗口和一个新的“扩展思考模式”。此模式允许 AI 在推理和行动之间交错进行,暂停以反思中间结果并调整其中途任务的方法。此功能对于 AI 代理尤其有利,特别是在编码任务中,使其能够推理整个代码库,规划跨多个文件的复杂重构,并更可靠地验证其工作。虽然基准测试显示 Sonnet 4.5 在多文件重构方面处于领先地位,但在单文件错误修复方面略微落后于 GPT-4.1 和 Gemini 2.5 Pro 等模型。 AI
影响 增强了 AI 代理在复杂推理和编码任务中的能力,有可能加速代理工作流中的开发。
排序理由 来自前沿实验室(Anthropic)的新模型发布,具有重大的新功能。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- 200K token context window
- AI agents
- Anthropic
- Claude API
- Claude Sonnet 4.5
- extended thinking mode
- Gemini 2.5 Pro
- GitHub
- GPT-4.1
- SWE-bench Verified
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →