Harvey's Legal Agent Benchmark
PulseAugur coverage of Harvey's Legal Agent Benchmark — every cluster mentioning Harvey's Legal Agent Benchmark across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Gemini 4 Argon 在基准测试中领先,但大多数用户仍无法使用
谷歌的 Gemini 4 Argon 模型在多项基准测试中表现出色,在许多类别中均优于 OpenAI 的 GPT-6 Astra 以及 Anthropic 的 Claude Opus 5.5 和 Claude Fable 5.1,尤其是在软件工程、法律和金融任务方面。尽管 Gemini 4 Argon 的基准测试结果强劲,但目前尚未广泛提供,仅限于谷歌的合作伙伴。Argon 的定价具有竞争力,尤其是在推出初期,使其比 GPT-6 As…
-
Google DeepMind 发布 Gemini 3.8 Flash 和 Cyber 版本
Google DeepMind 发布了其 Gemini 模型的新两个版本:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。Gemini 3.8 Flash 在速度和成本与前代 Gemini 3.7 Flash 相同的情况下,提供了更强的推理和编码能力,适用于通用企业用途和自主代理。Gemini 3.8 Flash Cyber 专为网络安全任务设计,在漏洞检测和自动化修复方面展现了前沿水平的性能,并通…
-
SpaceXAI 与 Cursor 合作推出 Grok 4.5,目标是处理复杂任务并提高代币效率 · 追踪 2 个来源
SpaceXAI 已推出 Grok 4.5,这是与 Cursor 合作开发的新型 AI 模型,旨在处理包括软件工程、法律和金融服务在内的各个领域的复杂、长期任务。该模型在代币效率方面取得了显著改进,据报道,在 SWE Bench Pro 上,其输出代币数量比 Anthropic 的 Opus 4.8 少约 4.2 倍。Grok 4.5 在 Harvey 的法律代理基准测试中也获得了最高排名,定价为每百万输入代币 2 美元,每百万输出代…
-
Fireworks AI 使用顾问模式提升 Claude Opus 4.7 性能
Fireworks AI 展示了一种新颖的方法,通过使用一个更小、更专业的模型(GLM 5.1)来指导一个更强大但成本更高的模型(Claude Opus 4.7),从而提升 AI 模型性能。这种“顾问模式”在 Harvey Legal Agent Benchmark 上显著提高了结果,以一小部分计算成本实现了更高的成功率。该公司详细介绍了这种推理基础设施的技术方面及其训练结果。