PulseAugur
实时 11:44:45
实体 Terminal-Bench 2.1

Terminal-Bench 2.1

PulseAugur coverage of Terminal-Bench 2.1 — every cluster mentioning Terminal-Bench 2.1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
17
90 天内 49
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 5
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.65

Terminal-Bench 2.1 will see increased usage by open-source LLM developers

The recent surge in powerful open-source LLMs (e.g., from Chinese labs and Nex AGI) that rival closed-source models necessitates robust evaluation. Terminal-Bench 2.1 is emerging as a reliable benchmark, replacing older metrics. As these open-source models are increasingly used for complex tasks, developers will likely adopt Terminal-Bench 2.1 to validate their performance against real-world agentic workflows.

observation resolved confirmed 置信度 0.75

Terminal-Bench 2.1 adoption driven by shift to real-world agent use cases

Recent evidence highlights a growing emphasis on evaluating agent performance based on real-world use cases rather than simple scores. Terminal-Bench 2.1 is explicitly mentioned as an upgraded benchmark designed for this purpose, alongside a 250-turn limit. This suggests that its adoption is likely to increase as the community prioritizes more practical evaluation methods.

observation resolved confirmed 置信度 0.75

Terminal-Bench 2.1 gaining traction as a key agent evaluation benchmark

The recent cluster evidence highlights Terminal-Bench 2.1 multiple times in the context of updated agent benchmarks that reflect real-world use cases. This suggests it is becoming a more prominent and reliable metric for evaluating AI agent performance, moving beyond older benchmarks like HumanEval.

hypothesis resolved confirmed 置信度 0.55

Terminal-Bench 2.1 will be integrated into more agent frameworks within 3 months

Given its increasing mention as a benchmark for real-world use cases and its inclusion in updated agent benchmarks, it's plausible that Terminal-Bench 2.1 will see broader adoption. Developers of agent frameworks may integrate it to provide more robust performance evaluations for their users.

查看全部假设 →

最近 · 第 1/3 页 · 共 49 条
  1. TOOL · CL_212036 ·

    新方法通过自适应选择验证任务来优化 LLM 代理线束

    研究人员开发了 Task-CoEvolve,一种用于优化大型语言模型 (LLM) 代理线束的新方法。该方法在优化过程中自适应地选择验证任务,专注于区分不同线束版本最有信息量的任务。通过与线束共同演化验证任务并从部分评估中估算全集性能,Task-CoEvolve 显著降低了评估成本。实验表明,Task-CoEvolve 在文本分类和 Terminal-Bench 2.1 基准测试等任务上,实现了与全集搜索相当的最终性能,同时将评估需求降…

  2. TOOL · CL_209817 ·

    Claude Code技能提升了DeepSeek V4 Flash在Terminal-Bench 2.1上的性能

    Claude Code的一个名为Autoprompt的新技能,显著提高了DeepSeek V4 Flash模型在Terminal-Bench 2.1基准测试上的性能。该技能通过规划、构建、测试、审查和修复代码,自动化了大部分编码循环,将DeepSeek V4 Flash的分数从67.42%提升至82.02%。虽然Autoprompt使用的token量大约翻倍,运行时长增加三倍,但它专为复杂任务设计,旨在提高工作质量。

  3. RESEARCH · CL_209438 ·

    Unsloth 发布 Qwen3.8-27B 的 Dynamic v3 量化版本,准确性得到提升

    Unsloth 发布了 Qwen3.8-27B GGUFs 的 Dynamic v3.0 量化版本,与其他提供商相比,在相同模型大小下准确性提高了 10% 以上。新版本采用改进的方法,使用更高质量的 imatrix 校准数据集和增强的量化技术,同时避免了 QAT 或 QAD。该版本包括保留显著准确性且体积更小的 1 位量化版本,非常适合内存有限的系统。

  4. RESEARCH · CL_210026 ·

    FACET框架通过一致的任务合成增强终端代理训练

    研究人员开发了FACET,一个旨在改进用于训练终端代理的可执行任务合成的框架。FACET通过确保指令、初始化环境、参考解决方案和验证器之间的一致性来解决创建高质量任务的挑战。该框架将代理技能重构为连贯的场景,修复执行环境,并将所有任务工件 grounding 在共享状态中,从而实现更有效和数据高效的代理训练监督。

  5. FRONTIER RELEASE · CL_209297 ·

    Ornith AI 发布 Ornith-1.5 模型系列,专注于自我改进

    Ornith AI 发布了 Ornith-1.5 模型系列,其中包括一个 9B 的密集模型以及 35B 和 397B 的混合专家(MoE)变体。这些模型旨在实现自我改进,并在推理、编码和代理任务等各种基准测试中表现出与 Claude Opus 4.8 等成熟模型相媲美的性能。这些模型可在 Hugging Face 上获取,并兼容 Transformers、llama.cpp、vLLM 和 SGLang 等流行推理工具,并提供了集成说明。

  6. TOOL · CL_204733 ·

    Claude 多模型编排在基准测试中适得其反,代价更高但效果更差

    一项将四个 Claude 模型连接起来用于 Terminal-Bench 2.1 基准测试的实验,揭示了多模型编排的显著弊端。该设置旨在利用一个强大的模型进行监督,而使用更便宜的模型执行任务,结果 Opus 模型拒绝执行有效的安全相关命令。此外,跳过的审查步骤和低效的委托导致与单模型方法相比,成本增加且成功率降低。作者发现,四模型系统解决了 78% 的任务,成本为 1,178 美元,在总排名中位列第七,并且比表现最佳的单模型昂贵得多。

  7. RESEARCH · CL_205935 ·

    StateM 运行时通过 Harness Scaling 提高 AI 代理准确性 · 跟踪 2 个来源

    研究人员开发了 StateM,一个旨在增强长时程 AI 代理性能而无需修改其底层模型权重的新运行时系统。该系统围绕持久化状态、可恢复的运行手册和可强制执行的过程控制来组织代理执行。StateM 在 Terminal-Bench 2.1 等基准测试中展示了显著的改进,将 GPT-5.5 xhigh 的准确率提高到 92.1%,并使用 GPT-5.6 Sol xhigh 达到了 95.3% 的原始准确率。它还以极低的适应成本将 DeepS…

  8. SIGNIFICANT · CL_197645 ·

    DeepSeek V4 Pro发布,多项编码能力挑战Fable 5 · 追踪2个来源

    DeepSeek 已正式发布其 V4 Pro 模型,这是其开源 AI 产品的一项重大进展。该新模型在智能体编码任务方面表现出色,在多项基准测试中可与 Fable 5 和 Anthropic 的 Claude Opus 4.8 等领先模型相媲美甚至超越。尽管 V4 Pro 模型功能强大且定价具有竞争力,但目前缺乏视觉支持,并且用户注意到其推理输出有所变化,这可能会影响创意写作任务。

  9. FRONTIER RELEASE · CL_197079 ·

    DeepSeek V4 Pro 0813 发布,在成本和能力上展开竞争

    DeepSeek 发布了其 V4 Pro 0813 模型,这是一个增强版本,具有改进的代理能力和性能,尤其适用于生产环境。该模型现已在 Hugging Face 和 Together AI 等平台上提供。基准测试表明,与 GPT-5.6 Sol 和 Claude Fable 5 等领先的专有模型相比,DeepSeek V4 Pro 0813 在软件工程任务上提供了具有竞争力的性能,尤其是在成本效益方面。

  10. SIGNIFICANT · CL_178016 ·

    DeepSeek V4-Flash升级以支持代理,保持优惠价格 · 跟踪1个来源

    DeepSeek已升级其V4-Flash模型,增强了其编码和代理能力,同时保持了低API定价。重新训练的284B参数模型每次请求激活约13B参数,从而实现了成本效益高的多步任务执行。此次升级使V4-Flash成为常规代理工作的可行替代方案,有可能迫使OpenAI和Anthropic等竞争对手降低其高端定价。

  11. COMMENTARY · CL_177654 ·

    DeepSeek V4-Flash基准分数因未发布的测试框架而受到质疑

    对DeepSeek V4-Flash模型的最新分析显示,其在Terminal-Bench 2.1基准测试中声称的性能与独立验证结果之间存在显著差异。DeepSeek自己发布的图表显示得分为82.7,但Artificial Analysis的独立测量记录为79。这个3.7分的差异很大,特别是考虑到DeepSeek声称领先GLM-5.2仅1.7分。这种差异似乎源于DeepSeek在其基准测试中使用了一个未发布的内部框架DeepSeek H…

  12. SIGNIFICANT · CL_174861 ·

    DeepSeek V4-Flash通过后训练增强,获得Agent API支持

    DeepSeek 更新了其 DeepSeek-V4-Flash 模型,重点在于后训练增强,而非架构更改或参数扩展。此修订版模型现已通过 API 提供,在 Terminal Bench 2.1 和 DeepSWE 等 Agent 特定基准测试中表现出改进的性能,尽管部分结果是使用专有工具和内部数据集实现的。此次更新还引入了对 Responses API 的原生支持,简化了与 Codex 等 Agent 框架的集成。

  13. SIGNIFICANT · CL_173933 ·

    ThinkyMachines在Together AI上发布Inkling-Small多模态模型

    ThinkyMachines已发布Inkling-Small,这是一个在Together AI上可用的开放权重多模态模型。该新模型在尺寸仅为Inkling的四分之一的情况下,提供了与之相当的性能,使其适用于编码、代理和通用多模态任务。Inkling-Small拥有2760亿个总参数和120亿个活跃参数,支持文本、图像和音频的原生推理,并支持高达100万个token的上下文窗口。

  14. RESEARCH · CL_193084 ·

    DarwinX 系统利用自然选择进化 LLM 智能体束缚

    研究人员推出 DarwinX,这是一个采用自然选择原理来进化大型语言模型 (LLM) 智能体“束缚”的新颖系统。DarwinX 不修改模型权重,而是通过将提示、工具、技能和控制流视为经历选择的种群来优化它们。这种方法旨在提高智能体在各种基准和任务上的能力和适应性,而无需手工挑选的解决方案或黄金标准。

  15. TOOL · CL_173627 ·

    Together AI 发布 Inkling-Small 多模态模型,支持 100 万上下文

    Together AI 推出了 Inkling-Small,一个由 ThinkyMachines 开发的开放权重多模态模型。该模型拥有 2760 亿参数,其中 120 亿活跃,提供跨文本、图像和音频的原生推理能力,并支持高达 100 万个 token 的上下文窗口。Inkling-Small 在性能上可与更大的 Inkling 模型相媲美,但成本和尺寸显著降低,使其适用于编码、代理任务和通用多模态应用。

  16. SIGNIFICANT · CL_166211 ·

    OpenAI 的 GPT-5.6 推出,具备大上下文窗口和节省成本的功能

    OpenAI 发布了其 GPT-5.6 模型系列,包括旗舰版 Sol 模型在内的三个变体。尽管此次发布涉及政治敏感的政府审查,但该模型提供了高达 105 万个 token 的上下文窗口。一个关键功能是提示缓存,它可以显著降低重复上下文的成本,但需要谨慎使用以避免费用增加。新模型还包括 ChatGPT Work,一个旨在与用户文件交互的代理。

  17. FRONTIER RELEASE · CL_162247 ·

    OpenAI、Moonshot、Anthropic 发布旗舰模型;基准测试显示各有千秋

    OpenAI、Moonshot AI 和 Anthropic 公司迅速发布了各自最新的旗舰模型:GPT-5.6 Sol、Kimi K3 和 Claude Opus 5。这三款模型都提供了巨大的上下文窗口和有竞争力的定价,但性能基准测试揭示了细微的差异。Claude Opus 5 在 SWE-bench Pro 等编码任务和 ARC-AGI-3 等推理基准测试中表现领先,而 GPT-5.6 Sol 在智能终端任务以及 DeepSWE 1…

  18. SIGNIFICANT · CL_159502 ·

    Poolside 的 Laguna S 2.1 模型优先考虑智能体效率而非规模

    Poolside 的 Laguna S 2.1 模型表明,智能体效率可以超越原始规模,在 Terminal-Bench 2.1 测试中取得了 70.2% 的分数。这个拥有 80 亿参数的模型采用了新颖的思考模式,成功解决了长期存在的数学问题,现在可以与市场上更大的参与者竞争。

  19. SIGNIFICANT · CL_158857 ·

    OpenAI 的 GPT-5.6 Luna 为常规 AI 任务提供价值层

    OpenAI 推出了 GPT-5.6 Luna,定位为价值层模型,用于常规任务,其每 token 成本显著低于同类模型。该模型专为有界工作设计,如分类、摘要和简单的代码编辑,旨在通过使频繁运行更经济来减少使用 AI 代理时的犹豫。另一方面,Terra 被定位为交互式和代码密集型任务的平衡默认选项,在价格更高的情况下,性能略有提升。Sol 仍然是复杂、高风险操作的高级选项,其高级功能证明了其成本的合理性。

  20. SIGNIFICANT · CL_157880 ·

    Poolside 的 Laguna S 2.1 开源模型超越 DeepSeek-V4-Pro-Max

    Poolside 发布了 Laguna S 2.1,这是一款拥有 1180 亿参数的专家混合(Mixture-of-Experts)模型,在 Terminal-Bench 2.1 基准测试中表现优于拥有 1.6 万亿参数的 DeepSeek-V4-Pro-Max。这款美国制造的开源模型拥有高达 100 万个 token 的上下文窗口,并具有独特的“思考”和“无思考”模式。该模型在不到九周的时间内开发和发布,采用 OpenMDW-1.1…