PulseAugur
实时 04:10:56
实体 AA-Briefcase

AA-Briefcase

PulseAugur coverage of AA-Briefcase — every cluster mentioning AA-Briefcase across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
时间线
  1. 2026-06-19 research_milestone SiliconFlow released the AA-Briefcase benchmark to evaluate LLM performance on long-horizon agentic knowledge work. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_236935 ·

    人工智能分析更新其智能指数,新增代理和长上下文任务

    人工智能分析发布了其智能指数的 v4.2 版本,引入了更复杂和更真实的任务,并增加了私有测试集以减少作弊。此次更新包括了新的评估项目,如用于代理知识工作的 AA-Briefcase 和用于长上下文文档推理的 GDP.pdf。此次中期发布旨在跟上前沿人工智能模型的快速发展,指数的权重分配中,有很大一部分已分配给保留测试数据,以更好地反映实际性能。

  2. RESEARCH · CL_156777 ·

    Kimi K3 在代理知识基准测试中排名靠前

    Kimi K3 模型在 AA-Briefcase 基准测试中表现强劲,仅次于 Fable 5。此次评估凸显了 Kimi K3 在代理知识任务中的能力。

  3. COMMENTARY · CL_116611 ·

    AI证实学习价值,开放模型引领复杂任务

    Ethan Mollick分享了AI驱动的分析见解,强调AI证实了基础学习的重要性。他还展示了AI能力的研究结果,特别指出开放权重模型在复杂、为期数周的咨询任务中保持显著优势,这一点由Artificial Analysis的AA-Briefcase分数表明。

  4. TOOL · CL_100580 ·

    SiliconFlow 发布 AA-Briefcase 大型语言模型基准测试,用于代理知识工作

    SiliconFlow 推出了 AA-Briefcase 基准测试,旨在评估大型语言模型(LLM)在长周期代理知识工作中的表现。该新基准测试已包含 GPT-5.5 和最近发布的 GLM 5.2 的得分,为比较代理任务性能提供了一个有用的工具。