一项新的研究论文探讨了在社会科学研究中使用大型语言模型(LLMs)进行政治事件编码的挑战。虽然更清晰、对LLM友好的代码本能显著提高分类准确性,但这种预测性能并不总是能转化为行为可靠性。研究表明,用于编码的LLM系统不仅应根据准确性进行评估,还应根据其维持底层编码逻辑的能力进行评估。 AI
影响 强调了在社会科学等专业领域,对LLM进行超越简单准确性的稳健评估的必要性。
排序理由 关于LLM应用和评估的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →