PulseAugur
实时 13:10:44
实体 Human Raters

Human Raters

PulseAugur coverage of Human Raters — every cluster mentioning Human Raters across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_193755 ·

    新的FanarGuard过滤器增强了阿拉伯语LLM的文化意识

    研究人员开发了FanarGuard,这是一种旨在解决阿拉伯语语言模型安全性和文化一致性问题的新型审核过滤器。该过滤器在一个包含超过468,000个提示和响应对的数据集上进行了训练,并由LLM裁判和人工评估员对其无害性和文化意识进行了评估。FanarGuard在人工标注方面表现出高度一致性,并在通用安全基准测试中达到了现有最先进过滤器的性能,凸显了对具有文化敏感性的人工智能安全保障的需求。

  2. RESEARCH · CL_50662 ·

    大型语言模型在自动化作文评分方面表现不一

    两篇新研究论文探讨了大型语言模型(LLMs)在自动化作文评分(AES)方面的有效性。第一篇论文综合了 65 项研究,发现 LLM 与人类在作文评分上的一致性高度依赖于上下文,并且差异显著。第二篇论文研究了在学习者语料库上进行领域自适应预训练(DAPT)以用于 AES,表明虽然有针对性的 DAPT 可以提高领域内评分,但并不能持续增强跨数据集的可迁移性。