PulseAugur
中
实时 05:13:34
实体 Benchmark Suites

Benchmark Suites

PulseAugur coverage of Benchmark Suites — every cluster mentioning Benchmark Suites across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_217493 ·

    大语言模型基准测试套件:使用标准化指标衡量进展

    基准测试套件通过提供标准化的测试框架,对于客观衡量大语言模型(LLMs)的进展至关重要。这些套件汇集了各种单独的基准测试,以提供模型能力的整体视图,减少评估偏差并确保可复现的结果。关键指标包括用于理解任务的Exact Match、用于生成任务的BLEU和ROUGE,以及用于语言建模质量的Perplexity,尽管现代方法也采用了LLM即评委(LLM-as-a-Judge)的方法。为确保有效性,基准测试套件必须解决数据污染问题,并采用统…

  2. TOOL · CL_153490 ·

    LLM基准测试套件:评估和进步的关键工具

    基准测试套件通过在各种任务和数据集上提供标准化测试,对于评估大型语言模型(LLMs)至关重要。这些测试集合能够对模型进行无偏见的比较,识别弱点,并跟踪自然语言处理(NLP)领域的进展。关键概念包括准确率和F1分数等评估指标,仔细的数据集选择,以及强大的模型比较技术,以确保LLMs满足现实世界的要求并具有良好的泛化能力。