PulseAugur
中
实时 03:04:21
实体 supervised fine-tuning

supervised fine-tuning

PulseAugur coverage of supervised fine-tuning — every cluster mentioning supervised fine-tuning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
250
90 天内 250
发布 · 30天
0
90 天内 0
论文 · 30天
230
90 天内 230
层级分布 · 90 天
主题
关系
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_287130 ·

    强化学习教师在模型合并研究中产生更强的学生模型

    一篇新发表在arXiv上的研究论文,题为“Train4Merge: 一项关于基于OPD的模型合并的RL与SFT教师的受控单教师研究”,调查了在单策略蒸馏(OPD)模型合并中,用于创建专家模型的不同训练算法的有效性。研究人员比较了监督微调(SFT)和强化学习(RL)教师,发现RL教师在代理、推理和感知领域持续产生更强的学生模型。研究观察到,RL指导下的学生模型恢复了更多教师的性能增益,其中一个案例甚至超越了教师的性能。

  2. RESEARCH · CL_285527 ·

    英伟达 Nemotron 3 经过微调,达到奥林匹克级别 AI 性能

    英伟达的 Nemotron 3 基础模型已成功微调,在国际信息学奥林匹克竞赛 (IOI) 和国际数学奥林匹克竞赛 (IMO) 中均取得了金牌级性能。该过程涉及在特定领域数据上进行监督微调 (SFT) 和强化学习 (RL),以及迭代的生成-评估-精炼推理循环。对不同模型大小,如 Nemotron-3-Nano-CC 和 Nemotron-3-Ultra-CC 进行了调整,证明了专业化可以在无需全新基础模型的情况下实现高性能。

  3. TOOL · CL_284388 ·

    新的TRACE方法审计LLM检查点中的有害SFT目标

    研究人员开发了一种名为TRACE的新颖方法,通过分析大型语言模型(LLM)的检查点更新来对其进行审计。该技术直接在模型的权重中识别有害监督微调(SFT)目标的持续痕迹,独立于模型执行或行为评估。TRACE使用参考几何来量化有害程度,在各种微调配置甚至部分检查点访问中保持稳定。这种仅限权重的审计方法为安全评估提供了补充信号,尤其是在行为测试受限的情况下。

  4. RESEARCH · CL_284269 ·

    LLM引导方法的效果与副作用评估 · 跟踪2个来源

    两篇新研究论文探讨了通过激活引导控制大型语言模型(LLM)的细微差别。第一篇论文来自arXiv,提出了一个实证框架来区分特征引导行为的能力与其在模型内部机制中的作用,发现观察到的引导能力并不总是反映模型的自然计算。第二篇论文也来自arXiv,介绍了SteerScope,这是一个全面的评估套件,旨在评估各种LLM引导方法在引导效果与意外副作用之间的权衡,并得出结论认为,当前的激活引导技术并不总是优于更简单的提示引导基线。

  5. TOOL · CL_280433 ·

    新的LESSER方法加速了LLM训练后数据选择

    研究人员开发了一种名为LESSER的新方法,用于选择大型语言模型的训练后数据。该技术利用输出层梯度来近似数据选择过程,而输出层梯度的计算成本远低于全参数梯度。LESSER在监督微调方面的计算成本降低了高达9.7倍,在强化学习基准测试方面降低了3倍,同时保持了下游任务的性能。研究表明,即使单个样本在输出层梯度和全梯度之间的排名不同,该方法也能选择梯度一致的批次。

  6. TOOL · CL_280158 ·

    研究论文分析语言模型中的语义遗忘

    一篇新研究论文探讨了语言模型中语义遗忘的现象,特别比较了监督微调(SFT)和强化微调(RFT)在分类任务上的表现。该研究使用线性-softmax策略将模型更新分解为语义和风格成分。它提出,虽然两种方法都表现出并行的语义更新,但SFT可能导致风格漂移和随后的遗忘,而RFT在某些条件下可以保持语义准确性。

  7. RESEARCH · CL_284257 ·

    新的SSRFT框架内化安全角色以实现稳健的LLM安全对齐

    研究人员引入了一个名为Supervised Safe-Role Fine-Tuning (SSRFT)的新框架,以改进大型语言模型 (LLM) 的安全对齐。与专注于明确拒绝模式的传统方法不同,SSRFT将安全重新定义为预定义安全角色的内化。该方法使用源自心理测量问题和有限越狱提示的安全角色问答数据集来合成角色一致的响应。实验表明,SSRFT能够实现更稳健且可泛化的安全对齐,减少过度拒绝并保留模型能力。

  8. TOOL · CL_278281 ·

    生产环境中 LLM 微调技术的指南

    本文提供了在生产环境中微调大型语言模型 (LLM) 的实用指南。它探讨了包括监督微调 (SFT)、LoRA、QLoRA、DAPT 和直接偏好优化 (DPO) 在内的各种技术。该指南旨在帮助用户决定何时使用检索增强生成 (RAG) 而非微调,以及如何平衡模型质量、成本、延迟和生产复杂性。

  9. TOOL · CL_276353 ·

    Amazon SageMaker AI 推出用于微调搜索代理的多轮强化学习

    Amazon SageMaker AI 现在提供一项多轮强化学习 (MTRL) 功能,旨在对大型语言模型 (LLM) 驱动的搜索代理进行微调。这种方法训练代理在交互序列中做出最佳决策,提高检索质量和可靠性,同时保持小型模型的速度和成本效益。MTRL 系统提供模块化接口、无服务器执行和各种策略梯度算法,以实现强大的代理训练。

  10. TOOL · CL_275200 ·

    新的采样方法提升了 LLM 的监督微调效果

    研究人员开发了一种新的采样算法,可以增强大型语言模型(LLM)的监督微调(SFT)。这种马尔可夫链蒙特卡洛(MCMC)方法将离策略数据轨迹转换为更符合同策略学习的方式,使 SFT 在泛化能力上能够媲美甚至超越传统的强化学习技术,并减少灾难性遗忘。该方法在科学技能获取和数学推理等各种任务中表现强劲,并将采样视为模型后训练的一种通用基元。

  11. TOOL · CL_275064 ·

    LineupRL框架通过可验证奖励增强时间序列标注

    研究人员开发了LineupRL,一个旨在改进时间序列标注的新型强化学习框架。该方法使用了一个可验证的奖励系统,其中大型语言模型充当验证器,根据生成的标题从干扰项中识别出正确的时间序列。LineupRL在多个基准测试中表现出优于监督微调和其他强化学习基线。其训练的视觉语言模型比用于蒸馏的模型小得多,也更有效。

  12. RESEARCH · CL_280182 ·

    新的两阶段训练方法使用评分标准来提升语言模型性能

    研究人员提出了一种新颖的两阶段语言模型训练框架,该框架利用评分标准来提高在缺乏精确结果验证的任务上的性能。第一阶段,即评分标准优先的策略内蒸馏(RP-OPD),使用评分标准作为特权教师上下文进行密集的token级监督。第二阶段则采用强化学习(RL)来优化评分标准奖励,将性能推升至初始蒸馏平台之上。该方法在健康和科学任务上使用开源模型进行了评估,在HealthBench、ResearchQA和RubricHub Science等基准测试…

  13. RESEARCH · CL_273184 ·

    研究发现AI模型难以进行隐藏推理

    一篇新的研究论文探讨了大语言模型(LLMs)中的隐写推理概念,即模型可能在其看似无害的文本中隐藏其真实的推理过程。研究发现,虽然模型可以轻松学习隐写信息和编码推理,但它们难以学习隐写推理本身,通常需要显著更多的训练数据和努力。然而,当一项任务被专门设计用于促进信息隐藏时,模型可以在各种训练方法中学习隐写推理,这表明它虽然比相关能力更难实现,但仍是可行的。

  14. TOOL · CL_273147 ·

    新的RLCD方法提高了推理模型的校准性和准确性

    研究人员开发了OpenJev-RLCD,一种用于推理模型校准决策中强化学习的新实现。该方法首先采样一个理由,然后使用严格的适当评分规则对答案分布进行评分,这会激励不同的理由。在Qwen3-1.7B推理任务上的实验表明,RLCD在准确性和选择性预测方面与监督微调和其他强化学习方法相当或更优。值得注意的是,在GSM8K答案验证方面,与GRPO相比,RLCD实现了更高的准确性和更低的错误率。

  15. TOOL · CL_268812 ·

    医学 VLM 审计揭示准确性与视觉效用之间的差距

    一篇新发表在 arXiv 上的研究论文详细介绍了一项对医学视觉语言模型(VLMs)及其训练后评估方法的受控审计。该研究聚焦于 Qwen2.5-VL-3B 模型,并比较了不同的训练后技术,包括监督微调(SFT)和低秩适配(LoRA),以及诸如 Group Relative Policy Optimization(GRPO)等标准方法。研究结果表明,尽管准确性指标可能有所提高,但某些训练后方法可能会无意中降低视觉受益事件和图像敏感性,这表…

  16. RESEARCH · CL_271009 ·

    新研究解决视频生成的一致性和效率问题

    近期研究探索了用于视频生成和编辑的先进技术,重点在于提高一致性、效率和个性化。论文介绍了像CtrlCache这样的方法,通过将计算适应用户控制来加速视频世界模型的交互式生成;以及S2PD,通过结合串行和并行扩散过程来生成更具物理和逻辑一致性的视频。其他工作,如VIDiff,旨在构建能够基于多模态指令执行编辑和增强等多样化视频任务的统一基础模型。此外,研究还通过LoGo等技术(用于改进3D一致性)和Weave Forcing(用于组合内…

  17. TOOL · CL_270377 ·

    新的OLIVE方法增强了语言模型从教师到学生的蒸馏

    研究人员推出了一种新颖的知识蒸馏方法OLIVE(OnLine InterVEntion),用于将大型教师语言模型中的知识蒸馏到小型学生模型中。与现有方法可能遇到的顺序协变量偏移或碎片化监督等问题不同,OLIVE允许学生模型生成前缀,然后由教师模型续写。之后,学生模型会根据这些教师生成的token进行更新。与以前的蒸馏技术相比,这种方法在推理性能和效率方面得到了提升,甚至在特定任务上超越了离线监督微调。

  18. TOOL · CL_259290 ·

    新方法优化AI Agent轨迹,降低成本并提高准确性

    研究人员开发了一种名为依赖感知轨迹优化(DATR)的方法,用于优化多轮AI Agent的微调。该技术将Agent轨迹表示为有向无环图(DAG),以识别和移除冗余步骤,例如失败的工具调用或不必要的验证轮次。通过在这些优化后的轨迹上训练Agent,研究人员在多个基准测试中展示了下游准确性的显著提高,同时还将Token数量减少了高达48%,消息数量减少了40%,从而降低了推理成本。

  19. TOOL · CL_257041 ·

    智能家居LLM剪枝:MoE模型比密集模型更具弹性

    一篇新的研究论文探讨了剪枝对大型语言模型(LLM)在智能家居工具调用特定场景下的影响。该研究系统地评估了剪枝引起的退化,涉及多种LLM架构,包括密集Transformer、密集混合模型和专家混合(MoE)模型,并使用了多种剪枝方法。结果表明,MoE模型比密集模型更能抵抗剪枝,并且剪枝会先影响具体细节的准确性,然后影响到模式层面的意图,这可能导致密集模型出现过度拒绝。

  20. TOOL · CL_256874 ·

    新框架MOCC-R1提高多模态咨询师回应一致性

    研究人员推出MOCC-R1,一个旨在增强多模态咨询师系统中推理与回应生成之间一致性的新框架。该框架通过利用MOCC(一个包含来自154名经过验证的咨询师的200多小时咨询互动的新语料库)来解决现有数据集的局限性。MOCC-R1采用两阶段方法,首先进行监督微调以生成包括客户状态理解和回应意图的结构化轨迹,然后进行强化学习以优化计划的连贯性和执行。