PulseAugur
EN
LIVE 09:17:09

New Data-DPO method optimizes LLM post-training data selection

Researchers have introduced Data-DPO, a novel method for selecting effective data samples during LLM post-training. This approach focuses on the compatibility between candidate data and the target model's capabilities by probing local training feedback. Data-DPO transforms activation differences into pairwise preferences, trains a lightweight reward model, and combines these preferences with external quality scores and diversity metrics for final subset construction. Experiments on Vision-Flan and LLaVA-CoT demonstrated that Data-DPO consistently outperforms existing data selection baselines and even surpasses full data training performance across various budgets. AI

IMPACT Optimizes LLM training efficiency and performance by improving data selection.

RANK_REASON The cluster contains a research paper detailing a new method for LLM post-training. [lever_c_demoted from research: ic=1 ai=1.0]

Read on arXiv cs.LG →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

New Data-DPO method optimizes LLM post-training data selection

COVERAGE [1]

  1. arXiv cs.LG TIER_1 English(EN) · Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu ·

    Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

    arXiv:2608.16926v1 Announce Type: new Abstract: Data selection in supervised fine-tuning aims to select a small set of effective samples from large-scale candidate data, reducing training cost while preserving model performance. However, existing methods usually treat data value …