一篇新发表在arXiv上的研究评估了情感分析工具和大型语言模型(LLMs)在处理社交媒体文本时的表现。研究发现,即使是人类标注员在分类情感时也只能达到中等程度的一致性,这凸显了任务固有的主观性。在评估的工具中,Twitter-roBERTa-base在二元情感分类方面与人类评分的匹配度最高,而Qwen3-32B、GPT-OSS-120B和Llama-4-Maverick-17B等大型语言模型则与人类表现出中等到实质性的一致性,并且它们自身之间也表现出高度一致性。 AI
影响 强调了在可靠的社交媒体情感分析中,需要进行领域特定微调和以人为中心的评估。
排序理由 评估大型语言模型和工具在特定任务上表现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Cohen's kappa
- Fleiss' kappa
- GPT-OSS 120B
- Himarsha R Jayanetti
- Llama-4-Maverick-17B
- Qwen3 32B
- TextBlob
- Twitter-roBERTa-base
- VADER
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →