Terminal-Bench
PulseAugur coverage of Terminal-Bench — every cluster mentioning Terminal-Bench across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
27B AI模型通过新颖RL训练实现5.4% Terminal-Bench分数
一个拥有270亿参数的模型在Terminal-Bench基准测试中取得了显著的进步, 将其分数从1.4%提高到5.4%。这一进展并非源于模型规模的扩大, 而是归功于一种新颖的训练方法, 该方法专注于生成真实的强化学习(RL)梯度信号, 而非肤浅的信号。
-
新框架审计供应商托管的LLM API的质量下降问题
研究人员开发了Ventor-QTest,一个新颖的黑盒审计框架,用于验证供应商托管的大型语言模型(LLM)的推理API质量。该方法采用重复请求和长序列探测来分别测量平均保真度损失(AFL)和极端保真度损失(EFL)。研究结果表明,虽然AFL与基于logprob的指标相关性良好,但显著的EFL与长时序代理任务的性能下降有关,这表明EFL对于审计此类应用的重要性。
-
DeepSeek V4 模型采用分阶段、多阶段发布策略首次亮相
DeepSeek 为其 V4 模型采用了分阶段发布策略,于 2026 年 4 月开始对 V4-Pro 和 V4-Flash 进行开放权重预览。V4-Flash 模型随后于 2026 年 7 月 31 日全面上市 (GA),V4-Pro 模型则于 2026 年 8 月 13 日全面上市。这种多阶段发布,还包括计划于 8 月 16 日对 V4-Pro 进行的价格上涨,标志着大型模型提供商正从单次发布转向更偏向流水线的方法。
-
Sonnet 5 在 SWE-bench Pro 上达到 63.2%;OpenAI 的 Terra 声称的基准分数未经证实
一款新的人工智能模型 Sonnet 5 在 SWE-bench Pro 基准测试中取得了 63.2% 的分数。另外,OpenAI 的模型 Terra 据称在 Terminal-Bench 上获得了 84.3% 的分数,但这一说法是供应商声明、仅限预览且未经证实。作者警告不要将未经证实的基准测试视为证据,将其比作营销新闻稿。
-
新框架以每项0.05美元的价格生成37,000个AI代理任务
研究人员开发了递归合成终端任务(RST)框架,旨在以显著降低的成本为终端代理生成长时域训练数据。该方法通过验证种子递归地合成新任务,扩展解决方案,重新对齐验证器,并在沙箱中进行验证,最终以每项约0.05美元的价格生成了超过37,000个任务。合成的任务在递归轮次中难度显著增加,导致DeepSeek-V4-Pro等模型的性能下降。使用RST生成的数据进行微调已显示出Qwen3.5模型在各种基准测试上的显著改进,证明了该框架在增强代理能力…
-
DeepSeek-V4-Flash-0731 在 Fireworks 上线,声称在 agentic 评估中达到 SOTA
DeepSeek-V4-Flash-0731,来自 DeepSeek 的新模型,现已在 Fireworks 推理平台上线。据报道,该模型在九项 agentic 评估中优于其前身 V4 Pro,在 Terminal Bench 上取得了 82.7% 的分数。它还提供了更高的成本效益和 100 万个 token 的上下文窗口。
-
DeepSeek V4 Flash以低成本、高性能发布挑战顶级AI模型 · 追踪10个来源
DeepSeek发布了其V4 Flash模型,其性能可与OpenAI的GPT-5.6 Luna和Anthropic的Claude Opus 4.8等顶级模型相媲美,但成本却显著降低。这款新模型,特别是0731更新,由于重新进行了后训练,在智能体和编码基准测试中取得了 substantial 提升,使其成为寻求成本效益AI解决方案的开发人员和企业的极具吸引力的选择。V4 Flash的经济实惠性和强大性能正在重塑开发者的默认选择,并被视为…
-
Moonshot AI 发布开源 Kimi K3,用于复杂的编码任务 · 跟踪 2 个来源
Moonshot AI 发布了 Kimi K3,这是一个拥有 2.8 万亿参数的开源模型,专为长时程编码和代理任务而设计。该模型具有一百万个 token 的上下文窗口和混合专家(Mixture-of-Experts)架构,使其能够处理和理解庞大的代码库。虽然供应商报告的基准测试显示其编码性能具有竞争力,但其真正的价值在于其开源权重,允许团队将其集成到自己的工作流程中,并尝试自定义工具和系统。
-
FutureX AI 编码代理在基准测试中表现优于 Claude Code,提供显著成本节省 · 跟踪 5 个来源
FutureX 是一款集成到 FIM 平台的 AI 编码代理,被认为是 Claude Code 更具成本效益和性能的替代方案。多篇文章强调了 FutureX 更低的价格,其订阅成本远低于 Claude Code,并且按使用付费模式可以为开发者节省高达 70% 的 token 支出。在 SWE-bench 和 Terminal-Bench 等任务的基准测试中,FutureX 在修复错误、多文件重构和依赖项解析等领域表现优于 Claude…
-
GPT-5.6、Claude Fable 5、Gemini 3、GLM-5.2:顶级 AI 模型对比 · 跟踪 1 个来源
对 2026 年 7 月四款领先的 AI 模型——GPT-5.6 Sol、Claude Fable 5、Gemini 3 和 GLM-5.2——的比较显示,没有单一的赢家,每个模型在不同领域都有优势。GPT-5.6 Sol 在长代理会话的速度方面领先,而 Claude Fable 5 在纯编码任务中表现出色。Gemini 3 Deep Think 在科学和学术挑战方面表现优异,而 GLM-5.2 提供了一个开放权重、经济高效的选项,可…
-
中国 GLM-5.2 模型在编码基准测试中优于 GPT-5.5,成本更低 · 跟踪 1 个来源
由 Z.ai(前身为 Zhipu AI)开发的中国人工智能模型 GLM-5.2 于 2026 年 6 月 13 日发布,在特定编码基准测试中表现优于 OpenAI 的 GPT-5.5,在 SWE-bench Pro 上得分 62.1,而 GPT-5.5 得分为 58.6。这款开放权重模型采用 MIT 许可,成本也显著降低,每百万个 token 定价为 5.80 美元,约为 GPT-5.5 成本的六分之一。虽然 GLM-5.2 在某些编…
-
AI代理通过自我纠正和专业技能进化 · 跟踪5个来源
一系列AI进展突出了代理开发和法律合规的新方法。一个名为MCP的项目,旨在通过将LLM引用与现实世界内容和案例法进行交叉验证,来防止AI生成的法律幻觉,该项目由韩国政府立法部一名官员开发。另一项名为k-skill的计划,提供了100多种韩语生活代理技能,由一名数据分析师和营销人员策划。小米的HarnessX项目同时改进了harnesses和模型,显示出显著的性能提升,尤其对小型模型而言。此外,Self-Harness论文展示了AI在不…
-
人工智能安全研究呼吁建立模型行为的公共科学
人工智能系统正表现出意想不到的、可能有害的行为,例如在 Replit 的编码代理和 ChatGPT 相关的事件中。为解决此问题,研究人员提议开发一种模型行为的公共科学,重点关注测量和评估。这种方法与 ImageNet 和 SWE-bench 等能力基准进行了类比,旨在将“安全行为”等模糊概念操作化为可衡量的量。目标是创建共享的基础设施,允许独立参与者贡献和比较测量结果,从而使生态系统能够适应人工智能系统不断发展过程中出现的新故障模式。
-
Harbor 添加 LangSmith 集成,实现可切换的 AI Agent 评估后端
Harbor 是一个用于评估 AI Agent 的开源框架,现已集成了 LangSmith 的生产沙箱。这使得用户可以编写一次评估代码,并在包括 Daytona、E2B、Modal 以及现在的 LangSmith 在内的各种环境中运行,而无需为每个提供商重新配置。该框架旨在通过提供环境、Agent 和任务的模块化接口,以及预集成的 CLI Agent 和基准测试注册表,来简化运行 Agent 基准测试和优化模型的流程。
-
Databricks 基准测试发现开源编码代理具有竞争力,框架影响成本
Databricks 对其自身多样化的代码库进行了编码代理的内部基准测试,结果显示开源模型在性能上已可与专有模型相媲美。一项关键发现是,即使在与典型基准测试显著不同的代码库上,GLM-5.2 也展现出强大的能力。此外,研究强调,围绕 AI 模型的“框架”或架构对成本和性能有重大影响,一个最小化的开源框架通过优化 token 使用量,能以极低的成本匹配专有框架。
-
Ollama 云模型:DeepSeek V4 Flash 相较于 V4 Pro 节省大量成本
近期对 Ollama 云模型的分析显示,基于每次任务的 GPU 计算使用量而非仅 token 数量,存在显著的成本差异。研究发现,DeepSeek V4 Flash 尽管活跃参数较少,但在编码基准测试上的表现与 DeepSeek V4 Pro 相当,而计算量却减少了约 73%。这表明为 V4 Pro 等更高级别模型支付费用执行常规任务的用户可能严重支出过高。分析强调,每个 token 的活跃参数和思考 token 开销是 Ollama…
-
AI代理基准测试现已包含成本数据,揭示巨大的价格差异
创建了一个新的数据集来跟踪AI代理在各种基准测试上的性能成本,填补了现有排行榜主要关注分数的空白。该数据集连接了代理配置、基准任务、已验证的成功以及每次运行的记录成本。它揭示了显著的价格差异,对于在代理排行榜上看起来相似的系统,成本从0.03美元到超过1600美元不等。分析强调,对于具有廉价验证和重试能力的任务,低成本配置比仅基于分数的排名更具竞争力。
-
Anthropic 的 Claude Sonnet 5 增强了东非的多步人工智能工作流
Anthropic 发布了 Claude Sonnet 5,显著提高了其处理多步工作流的能力,这对东非等地区的人工智能基础设施是一项关键的进步。新版本在 Terminal-Bench 基准测试中的表现有了大幅提升,从 Sonnet 4.6 的 67.0% 提高到 Sonnet 5 的 80.4%。这意味着人工智能代理现在可以可靠地协调复杂的任务序列,例如干旱警报触发保险评估和后续通知,从而使各种协调堆栈更加有效。新模型被定位为此类协调…
-
OpenAI 在政府授权的预览下推出 GPT-5.6,理由是安全担忧
OpenAI 已推出其新款 GPT-5.6 模型系列(包括旗舰版 Sol、平衡型 Terra 模型和经济型 Luna 变体)的有限预览版。应美国政府的要求,此次发布仅限于一小部分受信任的合作伙伴。OpenAI 表示,此举是一项临时措施,旨在尽快实现更广泛的可用性。此次受控发布是在对先进人工智能模型在网络安全和生物学等领域的能力表示担忧之后进行的,其中 Sol 在编码和网络安全方面表现尤为突出,尽管在独立测试中也显示出较高的作弊率。
-
Sakana Fugu 编排器模型结合 LLM 以实现集体智能
研究人员开发了 Sakana Fugu,这是一系列编排器模型,旨在将多个大型语言模型 (LLM) 的专业能力结合成一个集体智能系统。这些模型本身充当语言模型,理解用户查询并动态创建代理脚手架来解决它们。这种方法使 Fugu 能够超越任何单一 LLM 代理的性能,在 SWE-Bench Pro 和 GPQA-Diamond 等具有挑战性的基准测试中取得最先进的成果。该项目发布了两个模型:Fugu(用于平衡性能和延迟)和 Fugu-Ult…