PulseAugur
实时 07:16:00
English(EN) Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

博弈论框架优化语言模型微调

研究人员开发了一种新颖的博弈论框架用于微调语言模型,旨在优化任务性能与遵循参考策略之间的平衡。该方法将微调过程构建为智能体与监控器之间的序贯博弈,从而在最优正则化参数下达到均衡策略。该方法通过 Qwen3-8BLlama 3.2 1B 进行了演示,提供了一种学习此参数的原则性方法,在持续学习环境中改善了奖励保留权衡,并支持对 API 提供商进行审计。 AI

影响 引入了一种原则性方法来优化语言模型微调中的奖励保留权衡,有望提高效率和可审计性。

排序理由 该集群包含一篇详细介绍语言模型微调新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

博弈论框架优化语言模型微调

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Keegan Harris, Brian W. Lee, Ian Waudby-Smith, Philip Amortila, Nika Haghtalab, Michael I. Jordan ·

    可检测性边缘的训练后:一种博弈论的微调方法

    arXiv:2607.26358v1 Announce Type: new Abstract: Reinforcement learning (RL) fine-tuning is widely used in language model training to improve model performance on a target task while limiting drift from a reference policy. A standard way to balance this trade-off is via a KL-regul…