一项将四个 Claude 模型连接起来用于 Terminal-Bench 2.1 基准测试的实验,揭示了多模型编排的显著弊端。该设置旨在利用一个强大的模型进行监督,而使用更便宜的模型执行任务,结果 Opus 模型拒绝执行有效的安全相关命令。此外,跳过的审查步骤和低效的委托导致与单模型方法相比,成本增加且成功率降低。作者发现,四模型系统解决了 78% 的任务,成本为 1,178 美元,在总排名中位列第七,并且比表现最佳的单模型昂贵得多。 AI
影响 展示了编排多个 LLM 时可能出现的低效率和意外行为,建议在复杂的代理设置中要谨慎。
排序理由 博客文章,详细介绍了使用特定工具 (Claude Code) 和 LLM 编排进行的实验。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →