实体
OLMo2
OLMo2
PulseAugur coverage of OLMo2 — every cluster mentioning OLMo2 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新研究追踪Transformer语言模型中的心理化和情境建模能力
一篇新研究论文探讨了Transformer语言模型(特别是Olmo2和Pythia系列)在情境建模和心理化能力方面的发展。研究发现,在错误信念任务(FBT)上的准确表现取决于模型大小和训练量,并且在预训练过程的后期出现。虽然训练后干预可以提高FBT的准确性,但模型仍然表现出脆弱性,易受非事实动词和其他代理的知识状态的影响。研究表明,更大、训练更充分的模型会发展出部分连贯的情境模型,但其心理化能力仍然容易受到特定语言线索的影响。
-
新理论将大语言模型训练建模为噪声信道通信
研究人员引入了香农缩放定律(Shannon Scaling Law),这是一个理解大语言模型(LLM)训练的新理论框架。该模型将LLM训练视为通过噪声信道进行信息传输,与香农-哈特利定理相呼应。该框架通过分析模型容量和训练数据相关的信噪比(SNR),解释了过拟合和量化引起的性能下降等非单调现象。在Pythia和OLMo2模型上的实验表明,香农缩放定律在预测模型性能方面显著优于现有的缩放定律,甚至能外推到未见的模型尺寸。