TerminalBench 2.1
PulseAugur coverage of TerminalBench 2.1 — every cluster mentioning TerminalBench 2.1 across labs, papers, and developer communities, ranked by signal.
-
GitHub Copilot 预览 HydraFusion 多模型编排
GitHub 推出了 Project HydraFusion,这是 GitHub Copilot 的一项新研究预览功能,它编排多个 AI 模型以实现更高质量的代码辅助。该系统智能地为给定任务选择最佳模型或模型组合,针对性能、成本和延迟进行优化。在评估中,HydraFusion 展现了前沿水平的质量,媲美甚至超越了 Claude Opus 5 等模型,同时显著降低了预估的工作流成本。
-
OpenAI 发布 GPT-5.6 Sol,编码和网络安全分数创纪录
OpenAI 已正式推出其 GPT-5.6 Sol 模型系列,包含三个层级:Sol、Terra 和 Luna。旗舰 Sol 模型在 TerminalBench 2.1 编码基准测试中取得了创纪录的 91.9% 的分数,在网络安全测试中获得 96.7% 的分数,由于其先进的能力,引发了初步的政府审查。在受控预览期后,OpenAI 获得了公开发布的许可,其中包括一个灵活的三层定价结构,旨在满足各种开发人员和企业需求。
-
GPT-5.6 在基准测试中挑战 Fable 5,但长任务可靠性存疑 · 追踪 8 个来源
据报道,OpenAI 已发布 GPT-5.6,将其定位为 Anthropic 的 Claude Fable 5 的竞争对手。虽然 GPT-5.6 Sol 在聚合基准测试中表现强劲且价格显著更低,但 Fable 5 在处理长而复杂的任务和代理工作流方面表现更优。早期报告表明,GPT-5.6 在任务连续性和异常推理模式方面可能存在困难,尽管基准分数具有竞争力,但可能导致输出不准确或无意义。关于 GPT-5.6 的成本效益和速度是否能抵消 …
-
OpenAI 预览 GPT-5.6 系列,Sol Ultra 在 TerminalBench 上超越 Mythos 5
OpenAI 预览了其新的 GPT-5.6 模型系列,其中包括 Sol Ultra、Sol、Terra 和 Luna。GPT-5.6 Sol Ultra 模型在 TerminalBench 2.1 基准测试中取得了 91.9% 的分数,超过了 Anthropic 的 Claude Mythos 5,后者的得分为 88.0%。Terra 模型提供了与 GPT-5.5 相当的性能,但成本更低,而 Luna 被定位为最具经济效益的选择。新系…