一篇新发表在arXiv上的研究探讨了人类和大型语言模型(LLM)在促进在线讨论中的倾向。研究人员创建了PEFK语料库来标准化促进数据集,并使用专家参与者和LLM作为裁判模型进行了调查。研究结果表明,LLM过于渴望促进,而人类则更为谨慎,尽管两者在确定无需促进时都更确定。纠正LLM行为和训练ModernBERT分类器的尝试表明,分类器的性能更可靠,但当前的数据集限制了它们的性能上限。 AI
影响 在线审核中的LLM行为可能需要调整,以与人类的谨慎态度保持一致。
排序理由 该集群包含一篇详细介绍LLM行为研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Dimitrios Tsirmpas
- Gotit.pub
- Hugging Face
- LLMs
- ModernBERT
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →