PulseAugur
实时 10:14:52
English(EN) To Memorize or to Retrieve: Scaling the Interaction Between Pretraining and Retrieval

研究探讨语言模型中预训练与检索的权衡

一篇新的研究论文探讨了语言模型中预训练与检索的相互作用,研究了模型容量和预训练数据的扩展如何影响检索收益。研究发现,检索收益在很大程度上是前置的,在模型参数扩展的早期就实现了大部分改进。检索的表现收益是目标依赖的,小型模型表现出更好的困惑度,而大型模型则实现了更高的准确性。值得注意的是,从先前见过的数据中检索保留了其大部分有效性,这表明在语言模型设计中,数据在内部知识和外部访问之间进行了战略划分。 AI

影响 通过优化内部知识与外部检索之间的数据划分,提出了设计语言模型的新策略。

排序理由 该集群包含一篇详细介绍语言模型交互研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究探讨语言模型中预训练与检索的权衡

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng ·

    记忆还是检索:预训练与检索交互的规模化

    arXiv:2604.00715v2 Announce Type: replace-cross Abstract: Retrieval-augmented generation (RAG) improves language model (LM) performance by providing relevant context at test time for knowledge-intensive situations. In this work, we systematically study the trade-off between pretr…