PulseAugur
实时 14:53:46
实体 ITBench-AA

ITBench-AA

PulseAugur coverage of ITBench-AA — every cluster mentioning ITBench-AA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
时间线
  1. 2026-05-27 research_milestone Artificial Analysis and IBM Research launched ITBench-AA, a new benchmark for evaluating AI models on enterprise IT tasks, with initial results showing frontier models scoring below 50% on SRE tasks. 来源
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_56001 ·

    阿里巴巴的 Qwen3.7-Max 在企业 IT 基准测试中排名第三

    阿里巴巴的 Qwen3.7-Max 模型在 ITBench-AA 基准测试中取得了第三名的成绩。该基准测试专门评估人工智能模型在代理式方法下,在真实企业 IT 场景中的表现。Qwen 团队强调这一成就标志着在人工智能代理时代迈出了重要一步。

  2. RESEARCH · CL_55389 ·

    NVIDIA发布多模态模型;Hugging Face改进参数传输;IBM基准测试IT代理

    NVIDIA发布了Nemotron 3 Nano Omni,这是一款专为处理文档、音频和视频并具备长上下文能力的多模态智能模型。此外,Hugging Face在TRL中引入了增量权重同步,用于高效传输万亿参数模型。另外,IBM开发了一个名为ITBench-AA的新基准测试,显示当前最先进的模型在代理式企业IT任务上的得分低于50%。

  3. TOOL · CL_55113 ·

    前沿AI模型未能通过新的IT基准测试,得分低于50%

    一项新的基准测试ITBench-AA已发布,用于评估前沿AI模型在企业IT任务(特别是站点可靠性工程SRE)方面的能力。在初步测试中,即使是Claude Opus 4.7和GPT-5.5等最先进的模型,在诊断Kubernetes事件方面的得分也低于50%。该基准测试显示,模型在根本原因分析方面存在困难,并且更长的调查轨迹不一定会带来更高的准确性,有些模型会过度调查并识别出假阳性。