研究人员开发了AutoData,一个代理式系统,旨在自动选择用于大型语言模型的预训练数据。该代理将数据选择视为一个启发式工程问题,直接搜索利用词汇统计和困惑度等文档特征的可执行算法。AutoData根据代理模型的验证反馈迭代地改进这些算法,在单晚搜索中发现了一种数据选择方法,该方法优于人类设计的策展流程。所发现的方法在大规模应用中也显示出有效性,并改进了下游指标。 AI
影响 自动化了大型语言模型开发中一个关键的、劳动密集型的部分,有可能加速研究和部署。
排序理由 该项目是一篇研究论文,详细介绍了大型语言模型预训练中数据选择的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Autodata
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →