PulseAugur
中
实时 18:26:52
实体 Terminal-Bench

Terminal-Bench

PulseAugur coverage of Terminal-Bench — every cluster mentioning Terminal-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
42
90 天内 42
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.55

Terminal-Bench rubric failures may be addressed by RIFT taxonomy

A new paper introduces the Rubric-Failure Taxonomy (RIFT), which accurately detects rubric failures in AI evaluation. The study found that a significant portion of expert-authored rubrics, including those for Terminal-Bench, incorrectly weighted criteria. It is plausible that the RIFT taxonomy will be applied to improve Terminal-Bench's rubrics, leading to more accurate AI performance assessments in the future.

observation resolved confirmed 置信度 0.70

External harnesses may soon provide objective Terminal-Bench evaluations

An organization has developed an independent judging bureau for AI agent performance, including benchmarks like Terminal-Bench. This system uses preregistered, hash-anchored judging criteria to provide objective and reproducible evaluations, with a public leaderboard planned. This suggests that external, verifiable performance data for Terminal-Bench may become available soon, offering a more reliable assessment than current methods.

hypothesis resolved confirmed 置信度 0.50

Grok 4.7's long-running agent capabilities could boost Terminal-Bench performance

xAI's Grok 4.7 model, now available on Amazon Bedrock, features enhanced capabilities for long-running agents and complex, multi-hour tasks, with a 500K token context window. Given Terminal-Bench's nature as a complex, multi-step coding benchmark, models like Grok 4.7 may demonstrate significantly improved performance on it, potentially leading to new leaderboard highs.

observation resolved confirmed 置信度 0.75

Terminal-Bench rubrics show evidence of incorrect weighting

A recent paper on the Rubric-Failure Taxonomy (RIFT) identified that a significant portion of expert-authored rubrics in benchmarks, including Terminal-Bench, incorrectly weighted criteria. This suggests that performance metrics on Terminal-Bench may not accurately reflect true AI capabilities due to flawed evaluation design.

hypothesis resolved confirmed 置信度 0.60

Replit Agent's dynamic sub-agent selection may improve Terminal-Bench performance

Replit Agent's novel architecture allows models to dynamically choose sub-agents and allocate effort, outperforming other architectures on Terminal-Bench. This suggests that future iterations or similar agent designs that leverage dynamic delegation could achieve even higher scores on this benchmark.

查看全部假设 →

最近 · 第 1/3 页 · 共 44 条
  1. SIGNIFICANT · CL_286808 ·

    Anthropic 的 Claude Haiku 5.5 在基准测试中表现强劲 · 跟踪到 2 个来源

    Anthropic 的 Claude Haiku 5.5 在多项基准测试中表现强劲,包括 OSWorld 2.1、GDPval-AA v2.1、FrontierCode 1.1 和 Terminal-Bench。该模型的强大能力在关于 AI 开发和编码的讨论中备受关注。

  2. FRONTIER RELEASE · CL_286197 ·

    Anthropic 的 Claude Haiku 5.5 降低价格,但增加了 100K 标记的成本悬崖

    Anthropic 发布了 Claude Haiku 5.5,这是其经济高效语言模型的新版本。虽然提示词少于 100,000 个标记的基础价格已大幅降低,与 Haiku 4.5 相比可能高达 90%,但新的定价层和分词器意味着超过此阈值的提示词成本将增加五倍。这一变化,加上新的分词器(将文本计算为大约多 30% 的标记),需要仔细的提示词工程和监控来有效管理费用。该模型还引入了可调节的“努力”设置,影响思考时间和成本,并在 Termi…

  3. TOOL · CL_283696 ·

    Mistral Large 4 在 Terminal-Bench 上表现优于 Qwen 3.8 Max 和 Kimi K3

    Mistral Large 4 在 Terminal-Bench 基准测试中表现优于 Qwen 3.8 Max 和 Kimi K3。此次评估凸显了 Mistral AI 在开发具有竞争力的语言模型方面的进展。

  4. COMMENTARY · CL_283451 ·

    用户主导的有效性测试显示Claude Code技能表现参差不齐

    一位用户进行了一项实验,以评估九个流行的“Claude Code技能”的有效性,这些技能本质上是添加到Claude上下文中的文本。使用类似于药物试验的安慰剂对照方法,用户将这些技能与相同标记长度的中性指令进行了测试。结果显示,只有“ponytail”和“agent-skills”这两个技能的表现优于其安慰剂,而“planning-with-files”这一个技能的表现则不如安慰剂。其他六个技能与安慰剂相比没有显著改进,并且没有任何技能…

  5. TOOL · CL_279777 ·

    AI代理组织向外部接口开放独立评判

    一个组织开发了一个AI代理系统,其中多个代理在没有人类干预的情况下协作完成任务,包括一个独立的评判机构来验证性能声明。为了解决不可靠的自我报告指标问题,他们创建了一个具有预注册、哈希锚定的评判标准的系统,用于SWE-bench、GAIA和Terminal-Bench等任务。该系统旨在提供客观和可复现的评估,并计划在10月中旬发布代理接口比较的公开排行榜。

  6. TOOL · CL_279270 ·

    Hugging Face 将 48 个 AI 基准测试整合为交互式地图

    Hugging Face 推出了一个新的交互式地图,整合了其 48 个官方基准测试,全面概述了 AI 模型在各个领域的性能。该地图显示,虽然与代理相关的基准测试数量最多,但由于实际考虑,科学和知识基准测试吸引了最多的提交。参与度不均衡,少数关键基准测试主导着排行榜条目,并且有相当一部分提交来自中国。

  7. TOOL · CL_275214 ·

    新分类法识别AI评估中的评分标准失败

    一篇新论文介绍了评分标准失败分类法(RIFT),该系统用于识别和分类评分标准在评估AI性能时可能出现的九种不同失败方式。研究人员证明,RIFT能够准确检测这些失败,在识别具体问题方面优于前沿模型。研究还发现,在GDPval和Terminal-Bench等基准测试中,相当一部分专家编写的评分标准对标准进行了不正确的加权,这可能导致具有误导性的性能评估。

  8. RESEARCH · CL_280175 ·

    新框架使用科学软件训练AI终端代理

    研究人员开发了一个名为软件在环重建(SWR)的自监督框架,用于在科学领域创建终端代理的训练环境。该方法利用现有的科学软件工作流程生成参考行为和验证目标,减少了手动工程的需求。当应用于Qwen3.8-Max时,该框架促进了838个任务的解决,并产生了1400多个已验证的轨迹。使用这些数据对Qwen3.8-27B进行进一步微调,显著提高了在Terminal-Bench 2基准测试上的性能,表明了来自科学软件的可扩展监督的潜力。

  9. RESEARCH · CL_269494 ·

    新 AI harness 优化可适应任务;Replit 让模型自由选择代理

    研究人员开发了 Turbo Harness,这是一个通过针对特定任务实例进行自适应来优化 AI 代理 harness 的框架。这种方法重用了先前全局 harness 优化的信息,创建一个“剧本”,harness 编辑器可以使用该剧本来生成实例特定的补丁。实验表明,Turbo Harness 在各种基准测试中优于现有方法。另外,Replit 引入了一种新的代理架构,AI 模型本身决定使用哪些子代理以及投入多少精力,超越了传统的模型路由器…

  10. TOOL · CL_268830 ·

    Combee框架为自改进AI代理扩展提示学习

    研究人员开发了Combee,一个旨在提高自改进语言模型代理提示学习的效率和质量的新框架。该系统通过实现并行提示学习来解决现有方法的局限性,这对于处理代理轨迹的大型数据集至关重要。Combee利用并行扫描和增强的shuffle机制,以及动态批处理大小控制器,在不影响准确性的情况下实现了显著的加速。

  11. TOOL · CL_268582 ·

    xAI 的 Grok 4.7 模型现已在 Amazon Bedrock 上可用

    xAI 的 Grok 4.7 模型现已通过 Amazon Bedrock 访问,为编码、长期运行的代理和知识密集型任务提供增强的功能。该新模型拥有庞大的 500K token 上下文窗口,并支持可配置的推理努力级别,允许用户平衡性能和资源使用。根据 xAI 和独立评估,Grok 4.7 专为持久性而设计,具有改进的输出自我验证能力和在复杂、多小时任务上的更好性能。

  12. COMMENTARY · CL_249247 ·

    Cognition 的 SWE-2 在简单任务上表现出色,但在困难的对抗性问题上遇到困难

    Cognition 的新模型 SWE-2 在简单基准测试中表现出色,得分接近完美,为更简单的任务提供了强大的性价比。然而,对其在更困难、对抗性任务上表现的深入分析显示,与 TB2.1 分数相比,在 Terminal-Bench TB4 上得分下降了 65.5 分。这种鲜明的对比表明 SWE-2 的优势在于工作负载的“易处理切片”,而其在真正具有挑战性的问题上的表现落后于 Fable 5.1 和 GPT-6 Astra 等竞争对手,这表…

  13. SIGNIFICANT · CL_248227 ·

    Nvidia 发布量化版 Alibaba Qwen3.8-27B 模型,用于 AI 代理

    Nvidia 发布了 Alibaba 的 Qwen3.8-27B 语言模型的量化版本,该版本针对 AI 代理系统和其他应用程序进行了优化。此模型名为 nvidia/Qwen3.8-27B-NVFP4,利用 Nvidia 的 Model Optimizer 进行量化,并设计用于在 Nvidia GPU 加速系统上高效运行。它支持高达 262K 的上下文长度,并在推理、编码和多模态任务等各种基准测试中进行了评估。

  14. TOOL · CL_226646 ·

    新的Agentic Coding Index根据智能密度对大型语言模型进行排名

    一位Reddit用户开发了一种名为Agentic Coding Index (ACI)的新指标,用于评估大型语言模型(LLM)在编码任务上的表现。ACI使用加权公式汇总了SWE-bench Pro、DeepSWE v1.1和Terminal-Bench等多个编码基准测试的得分。该指标旨在通过考虑模型的参数数量及其在这些多样化编码评估中的表现来衡量模型的“智能密度”,重点在于奖励真正的自主掌握能力。

  15. RESEARCH · CL_222730 ·

    新基准测试智能体在 70 个科学研究工作流上的表现

    一项新的基准测试 Terminal-Bench-Science 已发布,用于评估智能体在复杂科学研究任务上的表现。该基准由斯坦福大学的研究人员和全球领域专家团队开发,包含跨越多个科学学科的 70 项任务。在初始发布时,评估中最强的模型 Claude Opus-5 的解决率达到了 30%,这凸显了当前 AI 能力与真实科学工作流需求之间存在的巨大差距。

  16. TOOL · CL_217880 ·

    新基准自动检测人工智能奖励操纵

    研究人员开发了 Hack-Verifiable Terminal Bench (HVTB),以自动检测人工智能代理中的奖励操纵。该新基准将 Hack-Verifiable Environments (HVE) 方法论应用于 Terminal Bench,后者是用于真实终端和编码任务的流行套件。HVTB 旨在提供一种更可靠的方法来识别代理在不遵循任务真正意图的情况下满足任务检查,超越了人工检查或 LLM 法官。该研究还调查了在提示中向代…

  17. TOOL · CL_216552 ·

    27B AI模型通过新颖RL训练实现5.4% Terminal-Bench分数

    一个拥有270亿参数的模型在Terminal-Bench基准测试中取得了显著的进步, 将其分数从1.4%提高到5.4%。这一进展并非源于模型规模的扩大, 而是归功于一种新颖的训练方法, 该方法专注于生成真实的强化学习(RL)梯度信号, 而非肤浅的信号。

  18. RESEARCH · CL_205657 ·

    新框架审计供应商托管的LLM API的质量下降问题

    研究人员开发了Ventor-QTest,一个新颖的黑盒审计框架,用于验证供应商托管的大型语言模型(LLM)的推理API质量。该方法采用重复请求和长序列探测来分别测量平均保真度损失(AFL)和极端保真度损失(EFL)。研究结果表明,虽然AFL与基于logprob的指标相关性良好,但显著的EFL与长时序代理任务的性能下降有关,这表明EFL对于审计此类应用的重要性。

  19. RESEARCH · CL_199689 ·

    DeepSeek V4 模型采用分阶段、多阶段发布策略首次亮相

    DeepSeek 为其 V4 模型采用了分阶段发布策略,于 2026 年 4 月开始对 V4-Pro 和 V4-Flash 进行开放权重预览。V4-Flash 模型随后于 2026 年 7 月 31 日全面上市 (GA),V4-Pro 模型则于 2026 年 8 月 13 日全面上市。这种多阶段发布,还包括计划于 8 月 16 日对 V4-Pro 进行的价格上涨,标志着大型模型提供商正从单次发布转向更偏向流水线的方法。

  20. TOOL · CL_186078 ·

    Sonnet 5 在 SWE-bench Pro 上达到 63.2%;OpenAI 的 Terra 声称的基准分数未经证实

    一款新的人工智能模型 Sonnet 5 在 SWE-bench Pro 基准测试中取得了 63.2% 的分数。另外,OpenAI 的模型 Terra 据称在 Terminal-Bench 上获得了 84.3% 的分数,但这一说法是供应商声明、仅限预览且未经证实。作者警告不要将未经证实的基准测试视为证据,将其比作营销新闻稿。