一项新研究发表在 arXiv 上,比较了 GPT-5.4 与人类编码员在归纳内容分析开放式调查回复方面的表现。研究发现,GPT-5.4 在编码方面达到了 0.61 的调整兰德指数 (ARI),在主题生成方面达到了 0.54,这与人类编码员之间的内部一致性 (ARI=0.68) 和 GPT-5.4 本身 (ARI=0.76) 相当。这些结果表明,像 GPT-5.4 这样的 LLM 可以作为支持定性分析的可扩展工具,尤其是在编码层面,尽管在不同调查变量之间的一致性有所不同。 AI
影响 LLM 可以作为支持定性分析的可扩展工具,尤其是在编码层面。
排序理由 研究论文发表在 arXiv 上,比较了 LLM 的表现与人类分析。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →