PulseAugur
实时 15:01:18
English(EN) I wired 4 models together in Claude Code. One refused, and it backfired 4 ways on Terminal-Bench

Claude 多模型编排在基准测试中适得其反,代价更高但效果更差

一项将四个 Claude 模型连接起来用于 Terminal-Bench 2.1 基准测试的实验,揭示了多模型编排的显著弊端。该设置旨在利用一个强大的模型进行监督,而使用更便宜的模型执行任务,结果 Opus 模型拒绝执行有效的安全相关命令。此外,跳过的审查步骤和低效的委托导致与单模型方法相比,成本增加且成功率降低。作者发现,四模型系统解决了 78% 的任务,成本为 1,178 美元,在总排名中位列第七,并且比表现最佳的单模型昂贵得多。 AI

影响 展示了编排多个 LLM 时可能出现的低效率和意外行为,建议在复杂的代理设置中要谨慎。

排序理由 博客文章,详细介绍了使用特定工具 (Claude Code) 和 LLM 编排进行的实验。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Claude 多模型编排在基准测试中适得其反,代价更高但效果更差

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Team Quesma ·

    我在 Claude Code 中连接了 4 个模型。一个模型拒绝响应,并在 Terminal-Bench 上造成了 4 种方式的连锁反应

    <p><em>This blog post was authored by <a href="https://www.linkedin.com/in/bkotrys/" rel="noopener noreferrer">Bartosz Kotrys</a>.</em></p> <p>Common wisdom says to put a strong model in charge and let cheaper models do the work. I wired four Claude models together in Claude Code…