PulseAugur
实时 08:01:48
实体 VA-DPO

VA-DPO

PulseAugur coverage of VA-DPO — every cluster mentioning VA-DPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_215931 ·

    新的VA-DPO方法实现了语言模型可控情感生成

    研究人员开发了一种名为VA-DPO的新方法,使语言模型能够生成具有可控情感的文本。与使用离散标签的先前方法不同,VA-DPO将期望的情感指定为效价-唤醒平面中的一个连续点。该方法通过使用一个固定的效价-唤醒回归器来对生成内容进行评分并构建偏好数据,从而修改了直接偏好优化。实验表明,VA-DPO显著减小了与目标情感的距离并提高了相关性,同时没有对MMLU、HellaSwag和TruthfulQA等基准测试的性能产生负面影响。