一位开发者针对特定的语音代理工作负载测试了 GPT-5.6 和 Claude Sonnet,发现 GPT-5.6 的效果明显不如 Claude Sonnet。测试重点关注模型在 74 个工具的模式中将请求正确路由到相应工具的能力,这是语音代理的关键功能。GPT-5.6 的成功率为 38.5%,而 Claude Sonnet 的成功率为 92.3%,这导致该开发者推迟了迁移计划。作者强调,这是一项特定于工作负载的测试,而不是对模型能力的通用基准测试。 AI
影响 强调了针对特定工作负载进行测试对于大型语言模型迁移的重要性,表明通用基准测试可能无法反映模型在特定应用中的实际性能。
排序理由 开发者分享了用于评估大型语言模型迁移的特定工作负载基准测试和方法,而非新的发布或官方基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →