研究人员开发了CARE(Community-Aware Reaction Evaluation,社群感知反应评估)框架,旨在评估大型语言模型(LLMs)模拟在线社群语言行为和态度的能力。CARE将LLM生成的论述与社群对新闻事件的真实反应进行基准测试,重点关注言外之意和潜在态度。框架的分析揭示了一个显著的“现实差距”,表明即使有明确的社群提示,LLM在准确模拟社会动态方面仍存在困难。此外,研究还识别了不同前沿模型之间独特的行为模式,表明当前的对齐策略不足以捕捉在线群体的社会语言学细微差别。 AI
影响 这项研究突显了大型语言模型在理解和模拟复杂社会动态方面的现有局限性,表明需要新的对齐策略。
排序理由 学术论文,介绍了一个评估大型语言模型对齐程度的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →