OLMo-2
PulseAugur coverage of OLMo-2 — every cluster mentioning OLMo-2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI模型学习读取内部状态的速度快于学习写入它们
一篇题为“滞后耦合:内部表征在因果化之前即可被读取”的新研究论文探讨了大型语言模型中内部表征的发展。该研究使用Pythia套件和OLMo-2,发现虽然模型在训练早期就可以从其内部状态中“读取”目标变量,但它们“写入”信息以对输出产生因果影响的速度要慢得多。这种被称为“滞后耦合”的现象表明,表征的形成可靠地领先于因果读取的巩固,并警示不要仅仅根据探针准确性来推断可控性。
-
研究探讨语言模型中预训练与检索的权衡
一篇新的研究论文探讨了语言模型中预训练与检索的相互作用,研究了模型容量和预训练数据的扩展如何影响检索收益。研究发现,检索收益在很大程度上是前置的,在模型参数扩展的早期就实现了大部分改进。检索的表现收益是目标依赖的,小型模型表现出更好的困惑度,而大型模型则实现了更高的准确性。值得注意的是,从先前见过的数据中检索保留了其大部分有效性,这表明在语言模型设计中,数据在内部知识和外部访问之间进行了战略划分。
-
新的Moir方法利用模型自身数据改进LLM知识编辑
研究人员开发了一种名为Moir的新方法,用于语言模型的知识编辑,解决了编辑后推理能力下降的问题。Moir直接从模型自身的解码分布中估计保留协方差,无需依赖Wikipedia等外部静态语料库。该方法在保留OLMo-2、Llama-3.1和Qwen-3等各种模型的数学和编程推理能力方面表现出显著的改进,优于基线方法。
-
新的PEFT方法mHC与LoRA结合可增强Transformer微调
研究人员推出了一种新颖的参数高效微调(PEFT)方法——流形约束超连接(mHC),用于Transformer模型。该方法修改了残差连接,这是其他PEFT技术通常保持不变的组件。虽然mHC本身并不总是优于LoRA,但在1B和7B参数的模型上,mHC与LoRA的组合在语言建模损失和特定任务基准测试中均有所提高。