发表在arXiv上的一项新研究表明,大型语言模型(LLMs)之间的一致性高于它们与人类读者之间的一致性。研究人员将LLMs的一致性与人类标注的参考集进行了比较,发现模型之间的一致性始终高于人类自然标注文本的方式。这种现象在来自不同供应商和国家的各种模型中都有观察到,即使是前沿模型,其自身一致性也比GPT-4o的自身一致性高出一倍。 AI
影响 表明LLMs可能正在形成内部共识,而这种共识与人类的解读存在差异,这可能会影响它们在需要细微人类对齐的任务中的效用。
排序理由 发表在arXiv上的研究论文,详细介绍了语言模型行为的发现。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →