PulseAugur
实时 18:22:23
实体 Human Preferences

Human Preferences

PulseAugur coverage of Human Preferences — every cluster mentioning Human Preferences across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_170917 ·

    价值泛化:一种新的AI对齐方法

    研究人员提出了一种新的AI对齐方法,称为“价值泛化”,旨在创建能够可靠地将人类价值观和偏好扩展到新情况的AI。这种能力被认为是当前AI系统的一个关键缺失环节,因为AI在遇到训练数据之外的场景时常常会失败。提出的方法涉及将AI的道德概念与经验概念绑定,使其道德能够随着其能力一起成长和适应,从而可能实现本质上更值得信赖和可控的“预对齐”AI。

  2. RESEARCH · CL_95833 ·

    新理论探讨 LLM 消费者行为和代理市场

    提出了一门名为 LLM 消费者行为理论的新兴研究领域,旨在分析作为自主代理的大型语言模型 (LLM) 如何影响消费决策。该理论借鉴了经济学和自然语言处理的原理,以形式化人类偏好如何被基于 LLM 的代理翻译和执行,从而影响市场需求。该框架旨在统一关于 LLM 决策和人类行为模拟的现有文献,并识别在对齐和市场动态等领域的未解问题。

  3. RESEARCH · CL_25817 ·

    新方法利用响应时间改进大型语言模型与多样化偏好的对齐

    研究人员开发了一种新方法,通过将响应时间纳入偏好数据集中,来改进大型语言模型与人类偏好的对齐。这种方法解决了标准方法中假设标注者具有统一偏好的局限性,而这种假设可能会扭曲学习到的模型策略。通过使用漂移扩散模型(Drift-Diffusion Model)对决策进行建模,这项新技术即使在存在异构和匿名反馈的情况下,也能识别出人群的平均偏好,其表现优于现有基线。