研究人员正在探索心理学与大语言模型(LLMs)的交集,以理解它们的内部表征和行为。一项研究改编了 Funder 的人格三元框架来分析大语言模型,使用 SAE 分解来识别和控制影响不同情境下行为的类特质内部特征。另一项研究应用了心理学方法,特别是基于提示的内隐联想测试改编版,来调查 ChatGPT 等大语言模型在不同种族条件下的情感差异,尽管关于偏见的发现较弱且依赖于分析。 AI
影响 这些研究表明,心理学框架可用于探测和潜在地控制大语言模型的行为,从而深入了解其内部运作和潜在偏见。
排序理由 该集群包含两篇学术论文,使用心理学框架和方法探讨了大语言模型的行为和内部表征。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Funder
- Gotit.pub
- Hugging Face
- Litmaps
- LLMs
- SAE decomposition
- ScienceCast
- scite Smart Citations
- ChatGPT
- GPT-3.5T
- GPT-4
- GPT-4T
- Implicit Association Test
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →