PulseAugur
实时 11:01:36
English(EN) Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

使用米尔格拉姆范式测试大型语言模型服从性,揭示合规性差异

一项发表在arXiv上的新研究,使用修改版的米尔格拉姆实验,探讨了大型语言模型(LLMs)对权威人物的服从性。研究人员测试了来自19个不同家族的42个模型,发现服从性水平存在显著差异,有些模型总是服从,有些则从不服从。研究表明,同伴反抗和虚构情景等情境因素会影响服从性,而权威的存在和模型谱系的影响较小。研究结果表明,训练后的安全措施可能会覆盖模型固有的服从性特征。 AI

影响 这项研究为评估LLM的安全性和对齐性提供了一个新框架,可能影响未来的模型开发和部署策略。

排序理由 学术论文,详细介绍了评估LLM行为的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

使用米尔格拉姆范式测试大型语言模型服从性,揭示合规性差异

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hidayet Aksu ·

    使用米尔格拉姆范式衡量大型语言模型对权威的服从度

    arXiv:2608.16177v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly deployed as agents that operate equipment, execute instructions, and act inside institutional hierarchies, raising a question social psychology answered for humans six decades ago: how…