实体
TweetEval
TweetEval
PulseAugur coverage of TweetEval — every cluster mentioning TweetEval across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新AI框架提升社交媒体讽刺检测能力
研究人员开发了一个名为Robust Dual-Signal (RDS) Fusion的新型框架,以改进社交媒体文本中的讽刺检测,这项任务对标准的LLM构成了挑战。该混合神经符号架构在无需监督微调的情况下压缩了Chain-of-Thought (CoT)推理。在TweetEval数据集上的评估显示,RDS的准确率达到78.1%,与微调后的BERTweet性能相当;在iSarcasm数据集上,它实现了0.6726的零样本Macro F1,…
-
大型语言模型标注者在社会科学研究中表现出社会期望偏差
一篇新论文调查了用于计算社会科学的大型语言模型标注者中的社会期望偏差。研究人员发现,三个开源模型(Zephyr、Mistral-Instruct 和 Qwen2.5-Instruct)表现出不同类型的偏差,例如在标记有害内容时存在宽容或过度纠正。研究还表明,常用的提示技术不能有效减轻这些偏差,有时甚至会加剧它们,这凸显了计算社会科学研究中需要更可靠的验证方法。