PulseAugur
实时 09:20:08
English(EN) LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-Mixup通过提炼低质量数据来增强LLM指令调优

研究人员推出了一种新颖的文本数据增强方法LM-Mixup,用于改进大型语言模型(LLMs)的指令调优。该技术通过将大量低质量或冗余数据提炼成连贯的指令-输出对,解决了高质量数据稀缺的问题。LM-Mixup过程包括在名为MIXTURE的提炼数据集上进行监督微调,然后通过Group Relative Policy Optimization(GRPO)使用质量、语义对齐和格式合规性奖励进行强化学习。实验表明,使用LM-Mixup增强数据进行微调的LLMs,其性能优于在完整数据集上训练的模型,并可与最先进的数据选择方法相媲美,证明了提炼低质量数据的价值。 AI

影响 通过更好地利用低质量数据进行指令调优,提高了LLM的效率和性能。

排序理由 该集群包含一篇详细介绍LLM数据增强新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LM-Mixup通过提炼低质量数据来增强LLM指令调优

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei ·

    LM-mixup: Text Data Augmentation via Language Model based Mixup

    arXiv:2510.20449v2 Announce Type: replace Abstract: Instruction tuning is crucial for aligning Large Language Models (LLMs), yet the quality of instruction-following data varies significantly. While high-quality data is paramount, it is often scarce; conversely, abundant low-qual…