一篇新论文认为,惊奇度理论(Surprisal Theory),通常被视为一种计算层面的解释,实际上并非与表征无关,尤其是在大型语言模型(LLMs)的背景下。作者认为,不加批判地使用 LLM 惊奇度指标会掩盖不同模型所做的底层表征和算法选择。通过三项分析,该论文表明算法和模型架构显著影响语言模型的概率,并敦促研究人员在测试惊奇度理论时重新考虑将 LLM 概率视为可互换的。 AI
影响 挑战了使用 LLM 概率进行研究的理论基础,可能影响语言模型能力的评估方式。
排序理由 一篇在 arXiv 上发表的关于语言模型理论方面的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →