Terminal-Bench 2.1
PulseAugur coverage of Terminal-Bench 2.1 — every cluster mentioning Terminal-Bench 2.1 across labs, papers, and developer communities, ranked by signal.
- instance of GPT 5.6 "Sol" 90%
- instance of GLM-5.2 90%
- used by Laguna S 2.1 90%
- competes with Claude Fable-5 80%
- used by GPT 5.6 "Sol" 70%
- used by Kimi k3 70%
- competes with Deepsweg 70%
- used by GLM-5.2 70%
- instance of Claude Opus-5 70%
- instance of Opus 4.8 70%
- competes with Claude Opus 4-8 70%
- competes with Opus 4.8 70%
11 天有情绪数据
Terminal-Bench 2.1 will see increased usage by open-source LLM developers
The recent surge in powerful open-source LLMs (e.g., from Chinese labs and Nex AGI) that rival closed-source models necessitates robust evaluation. Terminal-Bench 2.1 is emerging as a reliable benchmark, replacing older metrics. As these open-source models are increasingly used for complex tasks, developers will likely adopt Terminal-Bench 2.1 to validate their performance against real-world agentic workflows.
Terminal-Bench 2.1 adoption driven by shift to real-world agent use cases
Recent evidence highlights a growing emphasis on evaluating agent performance based on real-world use cases rather than simple scores. Terminal-Bench 2.1 is explicitly mentioned as an upgraded benchmark designed for this purpose, alongside a 250-turn limit. This suggests that its adoption is likely to increase as the community prioritizes more practical evaluation methods.
Terminal-Bench 2.1 gaining traction as a key agent evaluation benchmark
The recent cluster evidence highlights Terminal-Bench 2.1 multiple times in the context of updated agent benchmarks that reflect real-world use cases. This suggests it is becoming a more prominent and reliable metric for evaluating AI agent performance, moving beyond older benchmarks like HumanEval.
Terminal-Bench 2.1 will be integrated into more agent frameworks within 3 months
Given its increasing mention as a benchmark for real-world use cases and its inclusion in updated agent benchmarks, it's plausible that Terminal-Bench 2.1 will see broader adoption. Developers of agent frameworks may integrate it to provide more robust performance evaluations for their users.
-
FreeEvolve系统学会自动进化AI代理
研究人员开发了FreeEvolve,一个新颖的系统,可以自动设计语言模型的代理进化器。与依赖固定、手工设计的搜索循环的现有方法不同,FreeEvolve的进化器学会了关于测试、证据收集和候选者追求的决策。这种学习到的进化技能通过元进化得到进一步提高,其中候选技能根据它们产生的代理的性能进行评分。FreeEvolve在tau3-bench和ARC-AGI-2等基准测试中表现出显著的改进,优于手工设计的进化器,并显示出跨不同环境的可迁移学习。
-
新的EncBank方法通过可重用的编码器内存提高了LLM效率
研究人员开发了EncBank,一种通过将预训练LLM的较低层视为可重用的文档编码器来提高大型语言模型(LLM)查询效率的新颖方法。该方法将这些较低层的输出紧凑地存储起来供适配的上层读取器使用,减少了共享文档的冗余编码。EncBank使用一种自蒸馏的后缀适配器,可以在不同的存储精度下工作,而无需重新训练。在三个Qwen主干上的测试表明,在Qwen3-8B工作负载中,4位存储将基准聚合保持在与原生精度EncBank相差一个分数点之内,同时…
-
Cline AI 代理框架展示了灵活性但生产就绪度参差不齐
对 Cline AI 代理框架的技术评估显示,其生产就绪度方面结果不一。虽然 Cline 的架构允许独立选择模型和按使用量跟踪成本,但其操作复杂性和手动管理 API 密钥的需求带来了挑战。评估发现,Cline 将代理运行时与推理提供商分离,提供了灵活性,但也需要用户承担更多责任。然而,在 Python MCP SDK 初始化方面遇到了问题,并且 Terminal-Bench 基准测试被认为更适用于调试,而不是作为明确的性能比较。
-
DeepSeek Harness v0.2 发布桌面应用,增加 Claude Code Mods 支持
DeepSeek 发布了其开源代理框架 DeepSeek Harness (dsh) 的 0.2 版本,该版本现已包含 macOS 和 Windows 的官方桌面应用程序。此次更新引入了插件管理器、增强的文件和代码审查能力,以及调度自动化任务的功能。该框架设计为模型无关,通过 OpenAI 兼容的端点支持非 DeepSeek 模型,并为 Claude Code Mods 提供了一个实验性兼容层。
-
Qwen3.8-27B LLM 在 RTX 3090 上驱动编码代理
一位开发者详细介绍了他们在 RTX 3090 GPU 上使用 Qwen3.8-27B 大型语言模型进行编码任务的经验。他们成功地将该模型与 OpenCode 和 llama.cpp 集成,利用 GPU 的 24GB 显存进行推理。虽然该设置能够为小的修复和功能生成有用的代码补丁,但开发者也指出了输出预算耗尽和遗漏缺陷等局限性,这凸显了独立验证的持续重要性。
-
Apple 的 RLTL;DR 方法提升 AI 自我改进能力,而 LLM 社交学习效果参半 · 跟踪 3 个来源
研究人员开发了 RLTL;DR,一种新颖的 AI 自我改进方法,允许模型在失败尝试后生成并内化自己的反馈。该方法在具有挑战性的工具调用和编码任务上显示出显著的改进,即使在评估期间没有反馈的情况下,也能达到 14-31% 的 Pass@1。此外,研究正在探索 LLM 的递归社交改进,其中代理之间相互学习,但目前的 LLM 代理在效率和有效性方面难以超越独立学习者。
-
IQuest-Q1模型生成游戏并调试RL训练数据
IQuest Research发布了IQuest-Q1,一个拥有320B参数、稀疏MoE架构(激活15B参数)的模型。该模型展示了令人印象深刻的能力,包括根据简单Prompt生成功能性的HTML游戏,以及识别出RL训练数据中导致文本解码和轨迹拼接问题的细微bug。IQuest-Q1在NL2Repo、CyberGym、Terminal-Bench 2.1、DeepSWE v1.1和JobBench等各种基准测试中也表现强劲,在其参数类别…
-
Fireworks AI 发布 Ember-1,Kimi K3 的一个 token 使用量减少 40% 的变体
Fireworks AI 推出了 Ember-1,一个源自 Moonshot AI 的 Kimi K3 的模型。Ember-1 旨在产生更短的推理链,目标是在不影响任务准确性的情况下,将 token 使用量减少约 40%。这种优化是通过专门的后训练实现的,而不是简单地降低推理努力设置。Ember-1 目前可通过 Fireworks 无服务器 API 作为研究预览版提供,权重和训练细节未公开。
-
DeepSeek 的 V4.1 Flash 模型提供速度和低成本,但市场份额增长缓慢
DeepSeek 发布了其 V4.1 Flash 模型,这是一个拥有 552B 参数的专家混合(Mixture-of-Experts)模型,该模型速度惊人,并且 KV 缓存大小显著减小,使其成为最便宜的前沿模型之一。尽管该模型在各种基准测试中表现出色,并且采用了激进的定价策略,但它似乎在市场采用方面遇到了困难,与 OpenAI 等成熟的竞争对手相比,其 API 使用量仅占很小一部分。这种差距凸显了开发人员对尖端、经济高效的模型感兴趣,…
-
MetaRSI-v1 推进 AI 自我改进能力 · 跟踪到 1 个来源
CosmosMind 与多所大学合作推出了 MetaRSI-v1,这是一种新颖的元递归架构,旨在改进 AI 模型中递归自我改进 (RSI) 的过程。该新框架统一了模型、数据和工具改进等不同的 RSI 方法,使 AI 系统能够优化自身的学习和问题解决能力。实验表明,MetaRSI-v1 显著提升了小型 AI 模型和 GPT-5.6、Claude Opus-5 等前沿模型的性能。
-
Cognition 的 SWE-2 编码模型以更低的成本匹配 Fable 5.1
Cognition 发布了 SWE-2,这是一款使用 Moonshot AI 的 Kimi K3 模型进行强化学习后训练的新型编码模型。据报道,该新模型在 FrontierCode 基准测试上的表现与 Fable 5.1 相当,但成本显著降低。SWE-2 还引入了可选的推理工作量级别,在一次强化学习运行中进行训练,并且与前代 SWE-1.7 相比,在编码任务上展现出更高的效率和更少的绕路。
-
DeepSeek 弃用 V4-Pro 模型,转向更快、更便宜的 V4.1-Flash 变体 · 跟踪 3 个来源
DeepSeek 正在弃用其旗舰模型 DeepSeek V4-Pro,并将所有请求重定向到其 V4.1-Flash 变体。此决定是在内部和外部测试之后做出的,这些测试表明 V4.1-Flash 在能力、成本和速度方面优于 V4-Pro,甚至在 Terminal-Bench 2.1 等基准测试中超越了 Claude Opus 5 和 GPT 5.6 "Sol" 等模型。然而,V4.1-Flash 模型在事实问答方面表现出回归,Simpl…
-
字节跳动HarnessDev基准测试,评估LLM构建代理代码的能力
来自字节跳动Seed及其他机构的研究人员推出了HarnessDev,这是一个旨在评估LLM创建自身代理工具链能力的新基准。与固定工具链的传统基准不同,HarnessDev评估的是LLM自身生成的工具链代码的质量。初步结果表明,虽然LLM可以改进它们的工具链,但只有一部分改进能够泛化到不同的任务中,这表明完全自主改进的代理仍然是一个重大挑战。
-
针对 Claude Fable 5.0 等高级 AI 模型测试输出压缩工具
一项最新研究调查了像 Rust Token Killer (RTK) 这样的输出压缩工具在高级 AI 模型上的有效性。研究使用了 Claude Code with Fable 5.0 和 OpenCode with DeepSeek V4 Pro 0813,并在 Terminal-Bench 2.1 上运行测试。研究结果表明,随着 AI 模型能力越来越强,这些压缩工具的效用可能正在减弱。
-
RTK 代币节省声明受到独立 AI 编码成本基准测试的质疑
Hacker News 上的一篇博文质疑了 Rust Token Killer (RTK) 的有效性,RTK 是一种旨在通过压缩终端输出来降低 AI 编码成本的工具。虽然 RTK 声称节省了大量代币,但使用 Claude Code 和 DeepSeek V4 Pro 0813 在 Terminal-Bench 2.1 数据集上进行的独立基准测试显示结果好坏参半。对于 Claude Code,RTK 仅提供了 5% 的边际成本降低,但通…
-
Cognition 的 SWE-2 编码模型以高基准分数首次亮相
Cognition 发布了其新的编码模型 SWE-2,该模型采用专家混合(MoE)架构,拥有 2.8 万亿参数,每个 token 激活 1040 亿参数。据报道,该模型在 Terminal-Bench 2.1 基准测试中取得了 92.8 分,在 FrontierCode 等任务上表现强劲,但在处理更长周期的代理任务方面落后于 Claude Fable 5.1 和 GPT-6 Astra 等竞争对手。SWE-2 已集成到 Cogniti…
-
DeepSeek 的 V4.1 Flash AI 模型在基准测试中超越 Kimi K3 和 GPT-5.6 Sol
DeepSeek 推出了其 V4.1 Flash 模型,这是一个新的人工智能系统,据报道在特定基准测试中优于 Moonshot AI 的 Kimi K3 和 OpenAI 的 GPT-5.6 Sol 等竞争对手。该模型采用了新颖的“因果编码器-解码器”架构和专家混合(MoE)设计,使其能够激活其 5520 亿参数中的一小部分进行处理。这种效率对于面临硬件成本和芯片出口限制的中国人工智能开发者至关重要,使他们能够以较低的运营成本提供高性能模型。
-
Moonshot推出Kimi K3,拥有2.8万亿参数和100万上下文窗口
Moonshot 推出了其 Kimi K3 模型,这是一个拥有 2.8 万亿参数的混合专家模型,上下文窗口超过 100 万个 token。该模型采用了新的 Kimi Delta Attention 机制,结合了线性注意力和全注意力层以提高效率。虽然 Moonshot 发布了令人印象深刻的演示和供应商运行的基准测试,但文章强调了区分这些与客观可验证的结构事实和独立的第三方信号的重要性。
-
Google 和 Meta 发布新的专注于编码的 AI 模型
Google 和 Meta 分别发布了新的专注于编码的 AI 模型 Gemini 3.8 Flash 和 Muse Spark 1.3。这些模型旨在以低于旗舰模型的价格,处理大批量编码和代理任务。Gemini 3.8 Flash 在软件工程和命令行任务上表现强劲,而 Muse Spark 1.3 在银行和终端操作方面有了显著改进,但它仍然是一个专有的仅限 API 的模型。
-
SemiAnalysis 表示,公开的 AI 基准测试会因模型对其进行优化而迅速失去价值
SemiAnalysis 认为,像 TB 4.0 这样的公开 AI 基准测试会因模型对其进行优化而迅速过时,从而降低了它们评估真正泛化能力的有效性。他们以 Gemini 3.8 Flash 和 Muse Spark 1.3 为例,这些模型在 Terminal Bench 2.1 等旧基准测试上表现良好,但在 TB 4.0 等新基准测试上表现不佳,这表明私有的高质量基准测试是评估模型能力的更可靠的解决方案。分析还指出,像 Datacur…