PulseAugur
实时 15:39:29
实体 AttributedQA

AttributedQA

PulseAugur coverage of AttributedQA — every cluster mentioning AttributedQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_107685 ·

    研究发现LLM归因指标缺乏跨数据集的可迁移性

    一篇新的研究论文调查了用于评估检索增强生成(RAG)系统归因的自动指标的可靠性。研究发现,包括词汇、嵌入和BERTScore基线在内的常用归因指标在不同数据集和评估构造上表现不一致。指标排名可能显著反转,导致具体的决策成本,即基于平均性能选择指标可能比固定一个评分器更差。虽然LLM裁判提供了替代方案,但它们成本更高且不确定,将验证负担转移了,而不是消除了它。