Terminal Bench 2
PulseAugur coverage of Terminal Bench 2 — every cluster mentioning Terminal Bench 2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Qwen 3.6 量化模型显示智能体性能下降,知识回忆保持稳定
一个大学 HPC 集群对 Qwen 3.6 量化模型进行了基准测试,结果显示较低精度的版本在 Terminal-Bench 2 评估的智能体性能方面显著下降。虽然通过 GPQA Diamond 评估的知识回忆能力受量化影响很小,但与 Qwen 官方的 FP8 分数相比,研究观察到了一个显著的下降,这可能归因于不同的超时设置。研究人员还在对 GLM-5.2 量化模型进行基准测试,尽管这一过程被证明非常缓慢。
-
AI 自进化可能始于外部系统,而非模型权重
前 OpenAI 安全副总裁 Wonyong Li 提出了一条 AI 自进化的新路径,建议从外部操作系统(Harness)开始,而不是直接修改模型权重。该 Harness 系统负责管理工具使用、上下文、任务拆分和结果验证,并可根据观察到的失败进行迭代改进。DeepSeek 的崔天言等研究人员认为,改进 Harness 是 AI 进步的一个有前景的方向,有可能在不改变核心模型的情况下实现显著的性能提升。
-
MiniMax 发布 M3 模型,支持百万级上下文和强大的编码能力
MiniMax 发布了其 M3 模型,这是一款拥有百万 token 上下文窗口和原生多模态能力的前沿级 AI。该模型在编码基准测试中表现强劲,在 SWE-Bench Pro 上达到 59.0%,在 Terminal Bench 2 上达到 66.0%。早期用户注意到其令人印象深刻的前端能力,以及在体验上与 Anthropic 的 Claude 相似,但性能和价值更优。