研究人员开发了一种新流程,可将科学论文转化为多轮生成轨迹,用于语言模型的持续预训练。该方法重建了论文的写作过程,包括请求、计划和章节级别的讨论,同时保留原文 verbatim。由此产生的语料库来自 arXiv 论文,其大小约为源文本的两倍。这种方法还可以创建指令数据集和一个名为 PAW-Bench 的新学术写作基准。实验表明,在此语料库上进行持续预训练,然后进行监督微调,可以显著提高写作能力,而不会损害一般推理或长文档理解能力。 AI
影响 通过利用结构化的科学论文来增强 LLM 训练数据,有可能改善学术写作和长文档理解。
排序理由 该集群描述了一种处理科学论文以创建语言模型训练数据的新方法,该方法在 arXiv 预印本中有所介绍。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →