PulseAugur
实时 22:10:10
实体 BenchMIRT

BenchMIRT

PulseAugur coverage of BenchMIRT — every cluster mentioning BenchMIRT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_230874 ·

    BenchMIRT 工具质疑大型语言模型安全评估,发现推理偏见

    一款名为 BenchMIRT 的新工具已被开发出来,用于评估大型语言模型安全性和能力评估的有效性。对烧烤(BBQ)社交偏见评估的初步测试显示,这些问题主要根据模型的推理能力而非其安全特性来区分模型。

  2. TOOL · CL_230863 ·

    新的BenchMIRT基准测试对LLM评估方法提出质疑

    由艾伦人工智能研究所开发、Hugging Face发布的名为BenchMIRT的新基准测试,旨在重新评估大型语言模型(LLM)的评估方式。该基准测试对当前LLM评估方法的有效性和可解释性提出了质疑,表明需要更细致、更准确的测量技术。