一篇新的研究论文调查了像 Claude 3.5 Haiku 这样的大型语言模型在生成诗歌时是否表现出真正的规划能力,还是其明显的预见性仅仅是即兴创作。该研究测试了七种配置的开放模型(参数范围从 0.6B 到 2.6B)和六种开放跨层转码器(CLTs)。研究发现,模型可以泛化位置意识,但未能恢复在换行前预测押韵的证据,这表明在此规模和使用这些转码器的情况下,这种行为的因果位点是接近发射的,而不是一个独立的规划阶段。 AI
影响 调查大型语言模型文本生成的根本机制,可能影响未来的模型架构以及我们对涌现能力的理解。
排序理由 在 arXiv 上发表的研究论文,详细介绍了关于大型语言模型行为的实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →