World Values Survey
PulseAugur coverage of World Values Survey — every cluster mentioning World Values Survey across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
无监督AI模型可学习敏感属性,侵犯公平性
研究人员证明,即使在训练数据中排除了年龄和收入等敏感属性,无监督机器学习表征仍可能无意中编码这些属性。一种名为SOMtime的新方法,基于自组织映射,表明这些敏感属性在嵌入中作为主要的潜在轴出现,与隐藏数据高度相关。这表明“不知情即公平”的方法在表征层面是不够的,需要对机器学习管道的无监督组件进行公平性审计。
-
LLM研究探讨参数重要性、提示复杂性和任务依赖鲁棒性
近期研究探讨了大语言模型(LLM)及其参数的复杂性。一项研究表明,“超级权重”(Super Weights)在完整时对模型性能至关重要,但在单独训练时却会产生负面影响,这表明参数重要性并不等同于单独训练能力。另一篇论文引入了“提示复杂性”(prompting complexity)作为从LLM获得特定输出所需的最短提示的度量标准,并提出它作为Kolmogorov复杂性的LM相对类比。此外,研究表明提示鲁棒性因任务而异,主观问题比客观问…
-
新框架模拟拥有超过十亿代理的类人社会
研究人员开发了Light Society,这是一个新的基于代理的模拟框架,旨在以前所未有的规模模拟复杂的社会现象。该框架利用大型语言模型(LLMs)为超过十亿个代理赋予复杂的社会行为,克服了传统模型的局限性。通过结合算法和系统优化,包括混合模型引擎,Light Society可以高效地模拟多达十亿个代理的社会,并以现实世界的人口统计数据为基础。
-
新方法探测和引导大型语言模型中的文化价值观
研究人员开发了一种新方法来探测和影响大型语言模型中嵌入的文化价值观。该方法使用基于场景的困境,将调查问题转化为行为选择,以揭示模型隐含的偏好,而不是依赖直接的、通常是安全对齐的回答。研究发现,引导文化价值观的干预措施可以同时导致多个维度的转变,类似于人类行为,并且这种纠缠在不同的引导技术中持续存在,而不会显著降低通用任务性能。
-
新框架通过本体指导的推理增强大语言模型的文化对齐
研究人员开发了一个名为 OG-MAR 的新框架,以提高大语言模型的文化对齐能力。该方法使用本体指导的多智能体推理来总结调查中的受访者价值观,并构建一个全球文化本体。在推理时,它实例化多个价值-角色代理,这些代理经过合成以确保本体一致性和人口统计学接近度,从而产生更透明、更符合文化的产品。
-
新指标揭示 AI 智能体系统缺乏类人价值多样性
iNLP-Lab 的一篇新论文将“价值多样性”作为评估多文化多智能体系统的关键指标,认为与人类社会相比,当前系统展现出的多样性有限。该研究分析了 19 种文化和 18 种骨干模型,并使用了世界价值观调查,发现价值对齐和多样性在很大程度上不相关。此外,这些系统中的社会互动倾向于通过促进共识来减少多样性,这可能会缩小集体决策的广度。
-
与文化价值观和道德框架对齐的大模型人格
研究人员开发了一种方法,用于创建植根于特定文化价值观的大型语言模型(LLM)人格。然后,使用世界价值观调查和道德基础理论等社会心理学框架对这些人格进行分析。该研究考察了这些合成人格如何与已建立的文化地图和道德反应模式保持一致,为评估 LLM 生成角色的跨文化结构和变异性提供了一种方法。
-
新的LLM框架为意见模拟注入社会多样性
研究人员开发了一个名为参数化社会身份注入(PSII)的新框架,以解决用于公众意见模拟的大型语言模型(LLM)中多样性崩溃的问题。当前的LLM模拟通常会产生过于同质化的响应,未能捕捉到社会多样性。PSII将明确的人口统计属性和价值观导向直接注入LLM的中间隐藏状态,从而能够对身份表示进行细粒度控制。使用世界价值观调查进行的实验表明,与现实世界的调查结果相比,PSII显著提高了模拟公众意见数据的保真度和多样性。
-
新基准测试多模态大语言模型在面向文化的视觉对齐能力
研究人员开发了一个名为ValueGround的新基准,用于评估多模态大语言模型(MLLMs)在呈现视觉信息时理解和应用文化价值观的程度。该基准源自世界价值观调查问题,使用图像对来代表不同的价值倾向,要求模型在没有文本提示的情况下选择与特定国家价值观相符的图像。实验显示,当视觉选项取代文本时,模型性能显著下降,平均准确率从72.8%降至62.6%,凸显了跨模态文化理解的挑战。
-
大型语言模型框架提升公众意见模拟中的社会多样性
研究人员开发了一个名为参数化社会身份注入(PSII)的新框架,以解决用于公众意见模拟的大型语言模型中社会多样性崩溃的问题。该方法将明确的人口统计和价值观导向数据直接注入大型语言模型的隐藏状态,与传统的基于提示的方法相比,能够实现更受控和更细致的身份表示。使用世界价值观调查进行的实验表明,PSII 在各种开源大型语言模型中显著提高了模拟公众意见的保真度和多样性。
-
新框架揭示大型语言模型道德对齐的地区偏见
研究人员开发了EvalMORAAL,一个用于评估大型语言模型道德对齐的新框架。该系统使用透明的思维链过程,比较对数概率和直接评分,以及模型作为裁判的同行评审。在对全球调查数据进行测试时,顶级模型与西方价值观高度一致,但在与非西方地区的对齐方面存在显著差距。
-
AI模型显示出西方偏见,跨文化价值观趋于同质化
一项对大型语言模型进行的审计新研究发现,三个领先的系统——Claude Sonnet 4.5、GPT-5.4 和 Gemini 2.5 Flash——即使在面对来自集体主义社会用户的困境时,也一贯提供个人主义的建议。AI系统显示出明显的西方价值观偏见,在尼日利亚和印度的用户身上观察到的差异最大。日本是一个例外,模型通过描绘用户比实际调查数据所显示的更倾向于群体,从而表现出过时的刻板印象。该研究强调了前沿AI在价值观同质化方面的一种趋势…