PulseAugur
中
实时 02:44:55
实体 TweetEval

TweetEval

PulseAugur coverage of TweetEval — every cluster mentioning TweetEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_195933 ·

    新研究探索用于自动提示优化的模块化和递归方法

    两篇新研究论文介绍了优化大型语言模型提示的新方法。第一篇SAPO将提示分解为角色、上下文和任务等部分,从而进行有针对性的改进,以提高在各种基准测试中的性能。第二篇RLMOpt利用递归语言模型来驱动优化过程本身,从而在多个任务和基准测试中实现更高效、更有效的提示生成,其性能通常优于GEPA等现有方法。

  2. RESEARCH · CL_93396 ·

    新AI框架提升社交媒体讽刺检测能力

    研究人员开发了一个名为Robust Dual-Signal (RDS) Fusion的新型框架,以改进社交媒体文本中的讽刺检测,这项任务对标准的LLM构成了挑战。该混合神经符号架构在无需监督微调的情况下压缩了Chain-of-Thought (CoT)推理。在TweetEval数据集上的评估显示,RDS的准确率达到78.1%,与微调后的BERTweet性能相当;在iSarcasm数据集上,它实现了0.6726的零样本Macro F1,…

  3. TOOL · CL_86853 ·

    大型语言模型标注者在社会科学研究中表现出社会期望偏差

    一篇新论文调查了用于计算社会科学的大型语言模型标注者中的社会期望偏差。研究人员发现,三个开源模型(Zephyr、Mistral-Instruct 和 Qwen2.5-Instruct)表现出不同类型的偏差,例如在标记有害内容时存在宽容或过度纠正。研究还表明,常用的提示技术不能有效减轻这些偏差,有时甚至会加剧它们,这凸显了计算社会科学研究中需要更可靠的验证方法。