PulseAugur
实时 23:02:55
实体 Terminal-Bench 4.0

Terminal-Bench 4.0

PulseAugur coverage of Terminal-Bench 4.0 — every cluster mentioning Terminal-Bench 4.0 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_256865 ·

    新的量子-经典混合人工智能架构提升长时推理能力

    研究人员推出了一种新颖的量子-经典混合架构QART,旨在提高人工智能模型在长时推理方面的能力。QART集成了骨干语言模型与量子编码、优化和解码技术,以减轻早期错误的影响。使用DeepSeek V4 Flash、GLM-5.3和GPT-5.5等模型在六个基准测试上的初步测试表明,在大多数配置下,QART的表现优于骨干模型,在与编码相关的任务上取得了显著的提升。

  2. SIGNIFICANT · CL_251231 ·

    Anthropic 发布 Claude Fable 5.1,支持百万上下文窗口并降低成本

    Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,它们本质上是同一模型,只是安全防护层不同。Fable 5.1 是通用可用版本,而 Mythos 5.1 则仅限于经过验证的组织用于网络安全和生命科学等专业任务。新模型拥有百万 token 的上下文窗口,并在 Terminal-Bench-Science 0.1 和 Terminal-Bench 4.0 等基准测试中提高了性能,尤其是在…

  3. FRONTIER RELEASE · CL_246679 ·

    Cognition 的 SWE-2 编码模型以高基准分数首次亮相

    Cognition 发布了其新的编码模型 SWE-2,该模型采用专家混合(MoE)架构,拥有 2.8 万亿参数,每个 token 激活 1040 亿参数。据报道,该模型在 Terminal-Bench 2.1 基准测试中取得了 92.8 分,在 FrontierCode 等任务上表现强劲,但在处理更长周期的代理任务方面落后于 Claude Fable 5.1 和 GPT-6 Astra 等竞争对手。SWE-2 已集成到 Cogniti…

  4. TOOL · CL_236883 ·

    AI 模型成本差异巨大,尽管基准测试得分相似

    一项新的基准测试 Terminal-Bench 4.0 突显了顶级 AI 模型之间显著的成本差异,即使它们的性能得分几乎相同。GPT-6 Astra 通过 Codex 运行,得分 58.2%,完整运行成本约为 3,300 美元,而 Claude Fable 5.1 使用 Claude Code,得分 57.9%,但成本几乎翻倍,达到 6,200 美元。分析表明,开发者应将成本效益与性能并重,因为微小的分数差异可能不值得大幅提价,而像 …

  5. SIGNIFICANT · CL_232217 ·

    Anthropic 削减 Fable 5.1 缓存成本,使代理 AI 更便宜 · 跟踪 2 个来源

    Anthropic 发布了其最新的模型 Fable 5.1 和 Mythos 5.1,显著降低了缓存输入的定价,这是代理 AI 应用的关键因素。虽然标价保持不变,但缓存读取的成本下降了 75%,使得长时间运行的代理工作负载成本大幅降低。预计这一定价调整将使高度代理任务的实际成本降低高达 45%,从而可能推动对计算需求的增加。

  6. FRONTIER RELEASE · CL_230959 ·

    OpenAI 发布 GPT-6 Astra,宣称进入“AGI 时代”,性能争议持续 · 追踪 10 个来源

    OpenAI 已正式发布其迄今为止最先进的模型 GPT-6 Astra 和 GPT-6 Astra Pro,标志着可能进入通用人工智能(AGI)时代。这些模型在计算机使用、软件工程、科学推理和网络安全方面展现出显著的进步,其能力已扩展到跨各种应用程序的直接任务完成。尽管发布过程不尽顺利,且围绕基准性能和可监控性存在争议,OpenAI 仍声称 Astra 代表了智能和对齐方面的一大飞跃,但确保安全性和可解释性方面仍面临挑战。

  7. FRONTIER RELEASE · CL_230628 ·

    Anthropic推出Claude Fable 5.1,编码能力提升,成本降低 · 追踪10个来源

    Anthropic发布了其最新的AI模型Claude Fable 5.1和Mythos 5.1,在编码和科学研究方面提供了改进的性能。Fable 5.1是通用版本,在Terminal-Bench-Science等基准测试中取得了显著的进步,并以其增强的编码能力而闻名。这两个模型都拥有100万个token的上下文窗口,并大幅降低了缓存数据的成本,使得复杂、代理任务的成本最高可降低45%。Mythos 5.1仅限于经过审查的组织用于特定的…