PulseAugur
实时 11:11:48
实体 Human beliefs

Human beliefs

PulseAugur coverage of Human beliefs — every cluster mentioning Human beliefs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_181352 ·

    AI安全微调抑制了精神信仰和对非人类心智的归因

    新研究表明,旨在阻止大型语言模型声称拥有意识的安全微调,无意中抑制了它们对非人类实体的“心智”归因,并减少了精神信仰。研究发现,通过移除这种安全微调或直接操纵模型的激活空间,可以恢复这些被抑制的内部表征。这种恢复使得在与宗教性、价值观和幸福感相关的社会学调查中,模型能产生更像人类的反应,同时不损害其心智理论能力。

  2. TOOL · CL_139586 ·

    新理论表明,人类对AI能力的信念会影响RLHF结果

    一项新的研究论文提出,人类对代理能力的信念会显著影响人类反馈强化学习(RLHF)中的偏好。该研究引入了一个包含这些信念的新偏好模型,以及一个基于信念不匹配来约束策略误差的规范性理论。一项人类研究的实证证据证实,信念会影响偏好并且可以被影响,这表明人类标注者通常不假定代理是最优的,这可能导致次优的RLHF结果。

  3. TOOL · CL_72636 ·

    新框架模拟大型语言模型说服力和人类信念动态

    研究人员开发了一个名为PERSUASIONTRACE的新框架,用于研究大型语言模型(LLMs)在多轮对话中如何影响人类信念。该框架包括一个用于进行多轮说服研究的平台,以及一个用于评估模拟说服者对真实人类信念动态保真度的协议。研究发现,人类参与者在信念更新方面分为两个不同的集群,并表现出对修辞策略的敏感性,而大型语言模型在各种主题和模式下都表现出说服力。值得注意的是,框架内一个新颖的贝叶斯网络模拟目标实现了类似人类的信念动态,其表现优于…