研究人员开发了一个名为 Pancasila-Dilemmas 的新数据集,用于评估大型语言模型(LLMs)在多大程度上符合印尼人的价值观。该数据集包含 1,834 个基于印尼新闻的问题,重点关注五个核心价值观:宗教、人道、统一、民主和社会公正。对 50 个大型语言模型的初步评估显示,所有模型的表现都很差,概率匹配得分(Probability Match Score)低于 0.5,最大投票一致性得分(Max-Vote Agreement Score)低于 0.72,尤其在处理与宗教和统一相关的困境时表现困难。 AI
影响 凸显了大型语言模型在非西方语境下的价值观对齐方面的差距,可能推动更具文化意识的人工智能发展。
排序理由 该集群包含一篇介绍大型语言模型新数据集和评估方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Democracy
- Humanity
- Indonesian human values
- large language models
- Pancasila-Dilemmas
- Religion
- Social Justice
- Supryadi Supryadi
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →