PulseAugur
实时 11:01:02
English(EN) Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities

新的BIDS算法改进了LLM训练数据选择,以实现均衡能力

研究人员开发了一种名为BIDS(Balanced and Influential Data Selection,均衡且有影响力的数据选择)的新算法,以改进大型语言模型训练数据的选择过程。传统的基于影响力的方法可能导致不同任务之间的性能不均衡。BIDS通过对影响力得分进行归一化并迭代选择对代表性不足的任务贡献最大的数据点来解决这个问题。使用Llama-3和Mistral-v0.3进行的实验表明,BIDS的性能优于现有方法,甚至通过一小部分精心选择的数据子集取得了比全数据集训练更好的结果。 AI

影响 这项研究可能导致更高效、更有效的LLM训练,从而提高在更广泛任务上的性能。

排序理由 该集群包含一篇详细介绍LLM训练数据选择新算法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的BIDS算法改进了LLM训练数据选择,以实现均衡能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Qirun Dai, Dylan Zhang, Jiaqi W. Ma, Hao Peng ·

    改进基于影响力的指令调优数据选择,以平衡学习多样化能力

    arXiv:2501.12147v2 Announce Type: replace-cross Abstract: Selecting appropriate training data is crucial for instruction fine-tuning of large language models (LLMs), which aims to (1) elicit strong capabilities, and (2) achieve balanced performance across different tasks. Influen…