PulseAugur
实时 07:05:07
English(EN) VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models

新的VA-DPO方法实现了语言模型可控情感生成

研究人员开发了一种名为VA-DPO的新方法,使语言模型能够生成具有可控情感的文本。与使用离散标签的先前方法不同,VA-DPO将期望的情感指定为效价-唤醒平面中的一个连续点。该方法通过使用一个固定的效价-唤醒回归器来对生成内容进行评分并构建偏好数据,从而修改了直接偏好优化。实验表明,VA-DPO显著减小了与目标情感的距离并提高了相关性,同时没有对MMLU、HellaSwag和TruthfulQA等基准测试的性能产生负面影响。 AI

影响 使AI生成文本的情感表达更加细致和可控。

排序理由 该集群包含一篇详细介绍语言模型情感生成新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的VA-DPO方法实现了语言模型可控情感生成

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hyunwoo Kim ·

    VA-DPO:用于语言模型可控情感生成的价-唤醒度直接偏好优化

    arXiv:2608.20374v1 Announce Type: cross Abstract: How precisely can we tell a language model how to feel? Most work on emotional generation answers with a discrete label - happy, angry, sad - which cannot express a target like "mildly downcast but calm." We instead specify the de…