Anthropic 发布了 Claude 3.5 Sonnet,这是一款新的专注于编码的 LLM,在 SWE-bench Verified 基准测试中提高了 49.0%。该模型旨在通过快速微调过程和对大型代码库的高效上下文管理来减少幻觉并增强开发人员的工作流程。与此同时,OpenAI 的 GPT-4o 在其多模态默认行为方面遇到问题,其中路由层将图像和视频数据误解为文本,导致开发人员响应被截断且延迟增加。 AI
影响 Claude 3.5 Sonnet 的发布提供了一个专门的编码助手,有可能提高开发人员的生产力。GPT-4o 的问题突显了无缝多模态集成方面持续存在的挑战。
排序理由 前沿实验室(Anthropic)发布新模型,并附有基准测试结果。[lever_c_从 frontier_release 降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →