PulseAugur
中
实时 17:03:57
实体 EvalBench

EvalBench

PulseAugur coverage of EvalBench — every cluster mentioning EvalBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_205621 ·

    密集检索的分块策略的有效性和成本评估 · 跟踪 2 个来源

    一篇新论文评估了用于密集检索系统的八种不同的分块策略,不仅考虑了检索效果,还考虑了吞吐量和延迟等系统级成本。研究表明,计算成本高昂的分块方法并不总是优于更简单的方法,并且最佳策略取决于嵌入模型、语料库大小和特定检索指标等因素。此外,检索性能相似的方法可能具有显著不同的运营成本,这凸显了将分块视为一项多元设计决策的必要性。

  2. TOOL · CL_182392 ·

    EvalBench 使用灵活的数据模型简化了 LLM 评估模式

    作者描述了对 EvalBench 评估模式的重构,以简化新基准套件的添加。以前,每个新套件都需要数据库模式迁移、聚合查询更改和前端更新。通过将通用数据点折叠到单个 `MetricRecord` 模型中,并使用灵活的 `metrics` 字典来存储特定于套件的数据,现在添加新套件只需更改三个文件,无需修改数据库模式或聚合逻辑。

  3. TOOL · CL_153371 ·

    LLM评估工具EvalBench揭示关键统计错误

    大型语言模型评估平台EvalBench的创建者发现其统计计算中存在一个关键错误。该平台错误地报告了一个模型出现负重试次数,表明其置信区间计算方式存在缺陷。该错误源于在比例和延迟等不同指标类型上使用了单一区间公式,导致结果具有误导性,并夸大了模型性能差异。