实体
Situational Judgment Tests
Situational Judgment Tests
PulseAugur coverage of Situational Judgment Tests — every cluster mentioning Situational Judgment Tests across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新框架使用心理测量测试评估大型语言模型的行为一致性
研究人员开发了一个新的框架,使用情境判断测试(SJTs)和多维项目反应理论(MIRT)来评估大型语言模型(LLMs)的行为一致性。这种方法将LLM对场景的响应视为稳定、潜在行为变量的指标,而不是表面上的变化。研究发现,个性化条件下的行为在不同运行中是一致的,并且这些潜在特质可以预测在TruthfulQA和EmoBench等外部基准上的表现,与传统的自我报告技术相比,提供了一种更可靠的评估LLM行为的方法。
-
Google Research 评估大语言模型对齐并提高事实准确性
Google Research 开发了一个新的框架来评估大语言模型与人类社会倾向的行为对齐情况。该方法将已建立的心理学问卷改编成大规模情境判断测试,从而能够量化模型在现实场景中的倾向。研究发现了模型行为偏离人类共识或未能捕捉人类意见范围的差距,旨在改善大语言模型在社会动态中的导航能力。另外,Google Research 还推出了 SLED,这是一种新颖的解码策略,通过利用模型的所有层而不是仅最后一层来提高大语言模型的准确性,且无需外…