研究人员开发了 UNRESTSENT200K,这是一个包含约 200,000 条孟加拉语 Facebook 和 YouTube 评论的新数据集,这些评论与 2024 年 7 月至 8 月的孟加拉国起义有关。该数据集旨在评估低资源语言中的危机情绪分析,涵盖了事件的五个不同阶段,包括互联网中断和随后的洪水危机。该研究对包括微调编码器以及经过或未经过 LoRA 调优的大型语言模型 (LLM) 在内的各种模型进行了基准测试,发现父帖子的上下文可以提高性能,而跨危机阶段的时间变化会显著降低性能。尽管 LLM 表现强劲,但在讽刺和隐含的政治指涉方面仍存在挑战。 AI
影响 这项研究为理解 LLM 在低资源危机情绪分析中的能力提供了基准,这对于监测社会和政治事件至关重要。
排序理由 该集群描述了一篇介绍数据集并为特定任务对 LLM 进行基准测试的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →