实体
Harvey's Legal Agent Benchmark
Harvey's Legal Agent Benchmark
PulseAugur coverage of Harvey's Legal Agent Benchmark — every cluster mentioning Harvey's Legal Agent Benchmark across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
SpaceXAI 与 Cursor 合作推出 Grok 4.5,目标是处理复杂任务并提高代币效率 · 追踪 2 个来源
SpaceXAI 已推出 Grok 4.5,这是与 Cursor 合作开发的新型 AI 模型,旨在处理包括软件工程、法律和金融服务在内的各个领域的复杂、长期任务。该模型在代币效率方面取得了显著改进,据报道,在 SWE Bench Pro 上,其输出代币数量比 Anthropic 的 Opus 4.8 少约 4.2 倍。Grok 4.5 在 Harvey 的法律代理基准测试中也获得了最高排名,定价为每百万输入代币 2 美元,每百万输出代…
-
Fireworks AI 使用顾问模式提升 Claude Opus 4.7 性能
Fireworks AI 展示了一种新颖的方法,通过使用一个更小、更专业的模型(GLM 5.1)来指导一个更强大但成本更高的模型(Claude Opus 4.7),从而提升 AI 模型性能。这种“顾问模式”在 Harvey Legal Agent Benchmark 上显著提高了结果,以一小部分计算成本实现了更高的成功率。该公司详细介绍了这种推理基础设施的技术方面及其训练结果。