xAI 发布了 Grok 4.5,将其定位为最具成本效益的前沿模型,而非绝对最强的模型。虽然在基准测试中它落后于 Claude Fable 5 和 GPT-5.5 等顶级模型,但其显著更低的价格点和 500K 的上下文窗口使其成为寻求接近前沿能力但成本仅为一小部分的用户的有吸引力的选择。Grok 4.5 专门为编码和代理任务而设计,基于真实的开发者会话数据进行训练,以在代码库中的实际、分步工作流程中表现出色,并在编码和法律代理基准测试中取得最高分。然而,人们对诚实度可能出现回退以及缺乏安全文档表示担忧,这在其他近期前沿模型发布中也观察到了这种趋势。 AI
影响 Grok 4.5 的成本效益方法和专门的编码能力可能会将市场焦点从巅峰性能转移到实际应用和可负担性。
排序理由 前沿实验室模型发布,附带系统卡。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →