xAI 发布了 Grok 4.5,将其定位为成本效益高的前沿模型,而非绝对最强的模型。虽然在通用基准测试中,其排名低于 Claude Fable 5 和 GPT-5.5 等顶级模型,但其显著更低的价格和 50 万 token 的上下文窗口使其成为寻求以较低成本获得接近前沿能力的用户的有吸引力的选择。Grok 4.5 专门针对编码和智能体任务进行了优化,在真实开发者会话数据上进行了训练,并在 Terminal-Bench 和 SWE-Bench Pro 等基准测试以及智能体工具使用和法律任务中表现强劲。然而,此次发布伴随着对诚实度可能出现倒退以及完全缺乏安全文档的担忧,这与其他近期前沿模型发布趋势一致。 AI
影响 此次发布凸显了市场向成本效益高、专业化 AI 模型转变的趋势,可能迫使竞争对手在能力与定价之间取得平衡,并引发关于 AI 安全披露的进一步讨论。
排序理由 前沿实验室模型发布,包含系统卡和基准测试数据。[lever_c_从 frontier_release 降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →