PulseAugur
实时 09:59:32
实体 World Values Survey

World Values Survey

PulseAugur coverage of World Values Survey — every cluster mentioning World Values Survey across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 18
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. TOOL · CL_244786 ·

    LLM代理在社会科学研究中难以模拟多样化的人类价值观

    一项发表在arXiv上的新研究探讨了大型语言模型(LLM)代理在社会科学研究中准确模拟多样化人类价值体系的能力。研究发现,超过50%的模拟角色从一开始就未能代表其分配的价值档案,另有2-7%的角色随着时间的推移出现漂移。虽然LLM代理可以产生看似合理的对话,但它们目前难以忠实地代表和维持独特的人类价值档案,这表明它们作为社会科学研究代理的局限性。

  2. RESEARCH · CL_228818 ·

    新研究显示大型语言模型存在文化趋同和测量问题 · 跟踪 2 个来源

    两篇新研究论文探讨了大型语言模型(LLMs)的文化对齐问题,揭示了显著的权衡和测量有效性问题。第一篇论文《对齐但趋同》表明,为 LLMs 优化文化对齐会导致多样性丧失,模型会收敛于模仿占主导地位的文化多数的单一响应模式。第二篇论文《LLM 文化对齐中的测量有效性》强调,LLM 的调查响应对提示框架和随机种子高度敏感,常常使其表观文化立场与噪声无法区分。两项研究都表明,目前评估 LLM 文化理解的方法不足,并呼吁采用新的方法来保护文化多…

  3. TOOL · CL_215922 ·

    新框架增强了LLM对个体价值体系的模拟能力

    研究人员开发了ExpertIVS,一个旨在改进大型语言模型(LLM)模拟个体价值体系方式的新框架。与直接拼接调查问卷回复的先前方法不同,ExpertIVS利用14个社会学专家代理,通过专业视角解读世界价值观调查数据,确保了更高的语义重建和内部一致性。该方法旨在创建更稳健的个体画像,并使用多代理辩论机制评估动态交互中的价值取向。实验表明,ExpertIVS实现了高价值恢复保真度,并在价值泛化方面优于基线方法。

  4. RESEARCH · CL_191153 ·

    LLM 对齐研究凸显文化和社会人口统计学鸿沟

    两篇新研究论文探讨了将大型语言模型 (LLM) 与人类价值观对齐的细微差别,超越了简单的基于国家的分析。第一篇论文利用文化共识理论对群体内方差进行建模,揭示 LLM 常常未能捕捉到内聚的文化共识或过度规范化。第二篇论文聚焦欧洲,将国家层面的因素与教育、收入和宗教等社会人口统计学变量的影响分离开来,发现 LLM 在这些群体中的对齐程度不均。

  5. TOOL · CL_169578 ·

    研究发现:LLM的文化对齐因提示词框架而异

    一篇新的研究论文探讨了不同的提示词框架技术如何影响大型语言模型的文化对齐。该研究使用世界价值观调查中的问题,评估了GPT-5.4、Claude Sonnet 4.6、Gemini 2.5-Flash和Qwen3-235B。结果表明,提示词框架显著影响模型响应,其中第三人称预测提示词在大多数模型上显示出与人类文化价值观最强的对齐。个性化和角色扮演提示词效果较差或不稳定,对齐的提升集中在宗教信仰和性别角色等特定价值维度上,而机构信任等其他…

  6. TOOL · CL_156321 ·

    新的LLM个性建模纠正模拟中的分布崩溃

    研究人员开发了一种使用大型语言模型(LLM)模拟人群的新方法,该方法解决了当前方法中的一个关键失败模式。研究发现,使用独立的LLM代理来代表个体通常会导致响应分布崩溃,代理收敛于模态默认值。为了纠正这一点,该团队引入了一种名为Verbalized Sampling(VS)的“分布优先”方法,该方法提高了不同模型系列的保真度,但可能导致过度分散。研究还强调,调查保真度对代理行为的转移很弱,个性通常被最便宜的默认选项所主导。提出的校正方法…

  7. TOOL · CL_133531 ·

    无监督AI模型可学习敏感属性,侵犯公平性

    研究人员证明,即使在训练数据中排除了年龄和收入等敏感属性,无监督机器学习表征仍可能无意中编码这些属性。一种名为SOMtime的新方法,基于自组织映射,表明这些敏感属性在嵌入中作为主要的潜在轴出现,与隐藏数据高度相关。这表明“不知情即公平”的方法在表征层面是不够的,需要对机器学习管道的无监督组件进行公平性审计。

  8. RESEARCH · CL_124814 ·

    LLM研究探讨参数重要性、提示复杂性和任务依赖鲁棒性

    近期研究探讨了大语言模型(LLM)及其参数的复杂性。一项研究表明,“超级权重”(Super Weights)在完整时对模型性能至关重要,但在单独训练时却会产生负面影响,这表明参数重要性并不等同于单独训练能力。另一篇论文引入了“提示复杂性”(prompting complexity)作为从LLM获得特定输出所需的最短提示的度量标准,并提出它作为Kolmogorov复杂性的LM相对类比。此外,研究表明提示鲁棒性因任务而异,主观问题比客观问…

  9. TOOL · CL_117714 ·

    新框架模拟拥有超过十亿代理的类人社会

    研究人员开发了Light Society,这是一个新的基于代理的模拟框架,旨在以前所未有的规模模拟复杂的社会现象。该框架利用大型语言模型(LLMs)为超过十亿个代理赋予复杂的社会行为,克服了传统模型的局限性。通过结合算法和系统优化,包括混合模型引擎,Light Society可以高效地模拟多达十亿个代理的社会,并以现实世界的人口统计数据为基础。

  10. TOOL · CL_84922 ·

    新方法探测和引导大型语言模型中的文化价值观

    研究人员开发了一种新方法来探测和影响大型语言模型中嵌入的文化价值观。该方法使用基于场景的困境,将调查问题转化为行为选择,以揭示模型隐含的偏好,而不是依赖直接的、通常是安全对齐的回答。研究发现,引导文化价值观的干预措施可以同时导致多个维度的转变,类似于人类行为,并且这种纠缠在不同的引导技术中持续存在,而不会显著降低通用任务性能。

  11. TOOL · CL_72667 ·

    新框架通过本体指导的推理增强大语言模型的文化对齐

    研究人员开发了一个名为 OG-MAR 的新框架,以提高大语言模型的文化对齐能力。该方法使用本体指导的多智能体推理来总结调查中的受访者价值观,并构建一个全球文化本体。在推理时,它实例化多个价值-角色代理,这些代理经过合成以确保本体一致性和人口统计学接近度,从而产生更透明、更符合文化的产品。

  12. TOOL · CL_98578 ·

    新指标揭示 AI 智能体系统缺乏类人价值多样性

    iNLP-Lab 的一篇新论文将“价值多样性”作为评估多文化多智能体系统的关键指标,认为与人类社会相比,当前系统展现出的多样性有限。该研究分析了 19 种文化和 18 种骨干模型,并使用了世界价值观调查,发现价值对齐和多样性在很大程度上不相关。此外,这些系统中的社会互动倾向于通过促进共识来减少多样性,这可能会缩小集体决策的广度。

  13. TOOL · CL_70369 ·

    与文化价值观和道德框架对齐的大模型人格

    研究人员开发了一种方法,用于创建植根于特定文化价值观的大型语言模型(LLM)人格。然后,使用世界价值观调查和道德基础理论等社会心理学框架对这些人格进行分析。该研究考察了这些合成人格如何与已建立的文化地图和道德反应模式保持一致,为评估 LLM 生成角色的跨文化结构和变异性提供了一种方法。

  14. TOOL · CL_65888 ·

    新的LLM框架为意见模拟注入社会多样性

    研究人员开发了一个名为参数化社会身份注入(PSII)的新框架,以解决用于公众意见模拟的大型语言模型(LLM)中多样性崩溃的问题。当前的LLM模拟通常会产生过于同质化的响应,未能捕捉到社会多样性。PSII将明确的人口统计属性和价值观导向直接注入LLM的中间隐藏状态,从而能够对身份表示进行细粒度控制。使用世界价值观调查进行的实验表明,与现实世界的调查结果相比,PSII显著提高了模拟公众意见数据的保真度和多样性。

  15. TOOL · CL_62878 ·

    新基准测试多模态大语言模型在面向文化的视觉对齐能力

    研究人员开发了一个名为ValueGround的新基准,用于评估多模态大语言模型(MLLMs)在呈现视觉信息时理解和应用文化价值观的程度。该基准源自世界价值观调查问题,使用图像对来代表不同的价值倾向,要求模型在没有文本提示的情况下选择与特定国家价值观相符的图像。实验显示,当视觉选项取代文本时,模型性能显著下降,平均准确率从72.8%降至62.6%,凸显了跨模态文化理解的挑战。

  16. TOOL · CL_77120 ·

    大型语言模型框架提升公众意见模拟中的社会多样性

    研究人员开发了一个名为参数化社会身份注入(PSII)的新框架,以解决用于公众意见模拟的大型语言模型中社会多样性崩溃的问题。该方法将明确的人口统计和价值观导向数据直接注入大型语言模型的隐藏状态,与传统的基于提示的方法相比,能够实现更受控和更细致的身份表示。使用世界价值观调查进行的实验表明,PSII 在各种开源大型语言模型中显著提高了模拟公众意见的保真度和多样性。

  17. TOOL · CL_44752 ·

    新框架揭示大型语言模型道德对齐的地区偏见

    研究人员开发了EvalMORAAL,一个用于评估大型语言模型道德对齐的新框架。该系统使用透明的思维链过程,比较对数概率和直接评分,以及模型作为裁判的同行评审。在对全球调查数据进行测试时,顶级模型与西方价值观高度一致,但在与非西方地区的对齐方面存在显著差距。

  18. RESEARCH · CL_04994 ·

    AI模型显示出西方偏见,跨文化价值观趋于同质化

    一项对大型语言模型进行的审计新研究发现,三个领先的系统——Claude Sonnet 4.5、GPT-5.4 和 Gemini 2.5 Flash——即使在面对来自集体主义社会用户的困境时,也一贯提供个人主义的建议。AI系统显示出明显的西方价值观偏见,在尼日利亚和印度的用户身上观察到的差异最大。日本是一个例外,模型通过描绘用户比实际调查数据所显示的更倾向于群体,从而表现出过时的刻板印象。该研究强调了前沿AI在价值观同质化方面的一种趋势…