研究人员发现,使用直接偏好优化(DPO)微调的语言模型存在“强度不足”现象。当被指示生成具有特定情绪强度的文本时,诸如Llama-3.1-8B和Qwen3_8B等模型产生的输出强度远低于要求,效价(valence)仅提高0.26,唤醒度(arousal)仅提高0.13。这种现象似乎源于训练数据,这些数据通常缺乏极端情绪的例子,限制了模型学习和复制高强度情感的能力。通过使训练数据多样化以涵盖更广泛的情绪目标并增加采样候选的极端性,模型在生成所需情绪强度方面的表现有所改善。 AI
影响 凸显了当前LLM微调方法在控制情感表达方面的局限性,表明需要更多样化的训练数据。
排序理由 学术论文,详细介绍了关于LLM行为的具体发现。[lever_c_demoted from research: ic=1 ai=1.0]
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- EmoBank
- Fazzi et al.
- Llama-3.1:8b
- Qwen3_8B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →