实体
Human annotators
Human annotators
PulseAugur coverage of Human annotators — every cluster mentioning Human annotators across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新框架分析内容审核中的大型语言模型偏见
研究人员开发了一个名为“幽灵标注器”的新框架,用于分析内容审核任务中人类标注的变异性,特别是在使用大型语言模型进行标注时。该框架结合了一致性预测和协同过滤,以模拟大型语言模型相对于人类标注者的行为,识别模型预测与人类共识不符的情况。研究发现,较大的大型语言模型在对与任何人类标注都不符的内容进行分类时往往更自信,并揭示了人口统计学不匹配的一致模式,这表明预训练数据中存在偏见。
-
新基准揭示人工智能视觉错误信息检测失败
研究人员开发了SynCred-Bench,这是一个旨在评估人工智能生成视觉错误信息检测能力的新基准,该错误信息模仿了可信来源。该基准包括600张人工智能生成的图像和一组真实图像,以测试假阳性。评估显示,包括大型语言模型和开源工具在内的当前人工智能检测系统表现不佳,即使是人工标注者也难以识别此类合成可信度。
-
LLM改进NLI数据集错误检测和模型微调
一个名为EVADE的新框架使用大型语言模型(LLM)为自然语言推断(NLI)数据集中的错误检测生成和验证解释。该方法旨在降低传统两轮人工标注方法的成本和精力。实验表明,LLM验证的错误移除比人工识别的错误移除更能有效地提高NLI模型的微调性能,这表明LLM可以提高数据集的质量和可扩展性。