PulseAugur
中
实时 23:29:06
实体 Legal Agent Benchmark

Legal Agent Benchmark

PulseAugur coverage of Legal Agent Benchmark — every cluster mentioning Legal Agent Benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_220418 ·

    Fireworks AI 发布 Tenet 模型用于法律工作,在不增加成本的情况下提升性能 · 跟踪 5 个来源

    Fireworks AI 推出了 Tenet,这是与 Harvey 密切合作开发的、用于长期法律工作的新模型。Tenet 在 Kimi K3 基础模型上进行了后训练,在 Legal Agent Benchmark (LAB) 等法律基准测试中表现出显著的性能提升,全通过率从 10.8% 提高到 19.7%。这一进展是在没有成本增加的情况下实现的,每个任务的成本与其基础模型相似,但完成的任务量几乎翻倍。Tenet 在未专门训练的基准测试…

  2. FRONTIER RELEASE · CL_211314 ·

    Harvey 推出 Tenet,一个基于 Kimi K3 的后期训练法律 AI 模型 · 跟踪 4 个来源

    Harvey 推出了 Tenet,这是其首个专门为法律应用训练的专有 AI 模型。该模型基于 Moonshot 的 Kimi K3 构建,在 Legal Agent Benchmark 上任务完成率几乎翻倍,并能处理复杂的法律工作流程,展示了显著的性能提升。Fireworks AI 联合开发了 Tenet,旨在为专业 AI 开发提供基础。

  3. RESEARCH · CL_69533 ·

    Fireworks AI 通过混合模型方法降低法律AI成本

    Fireworks AI 展示了以显著更低的成本在法律AI任务上实现前沿水平性能的技术。通过采用一种混合机制,该机制使用开源模型作为工作者,并调用 Claude Opus 4.7 等高级模型作为特定子任务的顾问,他们将成本降低了 60% 以上,同时保持了高性能。此外,在其平台上进行后期训练,包括 Kimi K2.6 的监督微调,进一步提高了模型的能力和效率。

  4. FRONTIER RELEASE · CL_57679 ·

    Anthropic 发布 Claude Opus 4.8,增强了诚实度和速度

    Anthropic 发布了 Claude Opus 4.8,这是其旗舰 AI 模型的更新版本,特别强调“诚实”和改进的校准。据报道,这一迭代产生静默代码缺陷的可能性降低了四倍,并提供了更明确的不确定性标记,这对于使用自主编码代理的开发人员来说是一个显著的进步。此次发布还包括更快、更便宜的“快速模式”,并在 SWE-Bench Pro 等基准测试中取得进展,表明 Anthropic 的前沿模型正在持续快速的开发周期中。