PulseAugur
中
实时 03:29:56
实体 Long-Horizon Terminal Bench

Long-Horizon Terminal Bench

PulseAugur coverage of Long-Horizon Terminal Bench — every cluster mentioning Long-Horizon Terminal Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_186968 ·

    新框架以每项0.05美元的价格生成37,000个AI代理任务

    研究人员开发了递归合成终端任务(RST)框架,旨在以显著降低的成本为终端代理生成长时域训练数据。该方法通过验证种子递归地合成新任务,扩展解决方案,重新对齐验证器,并在沙箱中进行验证,最终以每项约0.05美元的价格生成了超过37,000个任务。合成的任务在递归轮次中难度显著增加,导致DeepSeek-V4-Pro等模型的性能下降。使用RST生成的数据进行微调已显示出Qwen3.5模型在各种基准测试上的显著改进,证明了该框架在增强代理能力…

  2. TOOL · CL_175300 ·

    AI模型评估需要超越简单分数的更丰富工具集

    当前主要依赖基准测试的AI模型评估方法,在准确评估能力和安全性方面存在不足。这些基准测试存在饱和、不可靠和易于被操纵等问题,属于执行错误。更根本的是,它们犯了范畴错误,提供了脱离上下文的分数,未能捕捉模型能力(尤其是在安全性方面)的真正含义或影响。该领域需要一个更丰富、更多样化的工具集来补充现有方法,并提供对AI系统更深入的理解。

  3. SIGNIFICANT · CL_154938 ·

    Grok 4.5 荣登 Long-Horizon Terminal-Bench 榜首,超越 Claude 和 GPT 模型

    Grok 4.5 在 Long-Horizon Terminal-Bench 评测中取得了第一名,超越了 Claude Fable 5、Claude Opus 4.8 和 GPT-5.6-sol。该排名基于严格的二元通过率,只有当任务完全解决、获得完美奖励且没有任何错误时才被视为成功。埃隆·马斯克强调了这一成就,称 Grok build “太棒了”。

  4. TOOL · CL_143601 ·

    MiniMax M3 在 Long-Horizon Terminal-Bench 上排名第七,开放权重版本领先

    MiniMax AI 的 M3 模型在 Long-Horizon Terminal-Bench 上取得了第七名的成绩。该基准旨在评估模型在长期任务上的表现。此外,该模型的一个开放权重版本在该基准的开放权重模型中名列前茅。Long-Horizon Terminal-Bench 约在五月份建立,此前数据显示,即使是表现最好的模型也只能完成 46 项任务中的 7 项,而所有测试模型的平均完成率为两项任务。