PulseAugur
中
实时 08:56:20
实体 Harvey's Legal Agent Benchmark

Harvey's Legal Agent Benchmark

PulseAugur coverage of Harvey's Legal Agent Benchmark — every cluster mentioning Harvey's Legal Agent Benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. FRONTIER RELEASE · CL_273073 ·

    Gemini 4 Argon 在基准测试中领先,但大多数用户仍无法使用

    谷歌的 Gemini 4 Argon 模型在多项基准测试中表现出色,在许多类别中均优于 OpenAI 的 GPT-6 Astra 以及 Anthropic 的 Claude Opus 5.5 和 Claude Fable 5.1,尤其是在软件工程、法律和金融任务方面。尽管 Gemini 4 Argon 的基准测试结果强劲,但目前尚未广泛提供,仅限于谷歌的合作伙伴。Argon 的定价具有竞争力,尤其是在推出初期,使其比 GPT-6 As…

  2. FRONTIER RELEASE · CL_232481 ·

    Google DeepMind 发布 Gemini 3.8 Flash 和 Cyber 版本

    Google DeepMind 发布了其 Gemini 模型的新两个版本:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。Gemini 3.8 Flash 在速度和成本与前代 Gemini 3.7 Flash 相同的情况下,提供了更强的推理和编码能力,适用于通用企业用途和自主代理。Gemini 3.8 Flash Cyber 专为网络安全任务设计,在漏洞检测和自动化修复方面展现了前沿水平的性能,并通…

  3. SIGNIFICANT · CL_132921 ·

    SpaceXAI 与 Cursor 合作推出 Grok 4.5,目标是处理复杂任务并提高代币效率 · 追踪 2 个来源

    SpaceXAI 已推出 Grok 4.5,这是与 Cursor 合作开发的新型 AI 模型,旨在处理包括软件工程、法律和金融服务在内的各个领域的复杂、长期任务。该模型在代币效率方面取得了显著改进,据报道,在 SWE Bench Pro 上,其输出代币数量比 Anthropic 的 Opus 4.8 少约 4.2 倍。Grok 4.5 在 Harvey 的法律代理基准测试中也获得了最高排名,定价为每百万输入代币 2 美元,每百万输出代…

  4. TOOL · CL_69259 ·

    Fireworks AI 使用顾问模式提升 Claude Opus 4.7 性能

    Fireworks AI 展示了一种新颖的方法,通过使用一个更小、更专业的模型(GLM 5.1)来指导一个更强大但成本更高的模型(Claude Opus 4.7),从而提升 AI 模型性能。这种“顾问模式”在 Harvey Legal Agent Benchmark 上显著提高了结果,以一小部分计算成本实现了更高的成功率。该公司详细介绍了这种推理基础设施的技术方面及其训练结果。