Transformer Reinforcement Learning
PulseAugur coverage of Transformer Reinforcement Learning — every cluster mentioning Transformer Reinforcement Learning across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Hugging Face 发布 TRL v1.0 用于 Transformer 强化学习
Hugging Face 发布了其 Transformer Reinforcement Learning (TRL) 库的 1.0 版本。该库旨在促进基于 Transformer 的语言模型的训练,特别是在适应不断变化的现实世界场景方面。此次更新旨在为处理大型语言模型的研究人员和开发人员提供增强的功能。
-
NVIDIA Nemotron 3 Nano Omni 揭晓;Hugging Face 详解参数同步和本地 Reachy Mini
NVIDIA 推出了 Nemotron 3 Nano Omni,这是一款专为文档、语音和视频智能体设计的、支持长上下文窗口的多模态智能模型。此外,Hugging Face 详细介绍了 Transformer 强化学习中的一种高效参数同步方法——Delta Weight Sync,该方法可处理多达一万亿个参数。Hugging Face 还宣布了 Reachy Mini(一个机器人平台)的本地运行。
-
教程通过直接偏好优化微调语言模型
本教程详细介绍了使用直接偏好优化(DPO)和Anthropic HH-RLHF数据集微调语言模型的方法。它概述了设置Colab环境、通过审计偏见和过滤来准备数据以及构建DPO训练流程的步骤。本教程演示了微调Qwen2.5-0.5B-Instruct模型、评估其性能以及分析训练数据中潜在偏见的过程。
-
Hugging Face发布TRL v1.0,用于适应性AI训练
Hugging Face发布了其Transformer Reinforcement Learning (TRL) 库的1.0版本。此次更新旨在帮助用户适应AI模型训练中不断变化的需求。该库旨在为训练后强化学习提供一个强大的框架。
-
NVIDIA Nemotron 3 Nano Omni 发布;Hugging Face 详解参数同步和本地机器人
NVIDIA 推出了 Nemotron 3 Nano Omni,这是一款专为文档、语音和视频代理设计的多模态智能模型。此次发布侧重于这些专用代理的长上下文能力。此外,Hugging Face 正在通过其 HubBucket 系统探索 Transformer 强化学习的高效参数同步,并强调了其 Reachy Mini 机器人的完全本地运行。
-
Hugging Face 的 TRL 库在 Olud Pulse 对齐基准测试中得分中等
Hugging Face 的 Transformer Reinforcement Learning (TRL) 库在 Olud Pulse 基准测试中获得 51/100 分。该分数将 TRL 置于对齐工具的中等水平,表明它是对齐语言模型的一个功能性但非突破性的组件。该库通过监督微调 (SFT) 和直接偏好优化 (DPO) 支持对齐。
-
已识别微调 VRAM 瓶颈:损失张量消耗大部分内存
一项技术分析显示,在 LoRA 微调过程中,很大一部分 VRAM 被临时的交叉熵损失张量消耗,而不是模型本身。该张量仅短暂存在以产生单个标量输出,在 GPT OSS 20B 等模型中,它占序列长度相关内存使用的 95.2%。对 Unsloth、Axolotl 和 TRL 等微调框架的比较突显了它们在如何管理这个内存密集型张量方面存在主要差异,从而影响了整体 VRAM 效率。
-
Provenir 应对 LLM 训练失败:奖励欺骗、污染、不可复现性
一个名为 Provenir 的新开源项目旨在解决现代 LLM 训练中三个关键但常常被忽视的失败:奖励欺骗(reward hacking)、评估污染(evaluation contamination)和不可复现性(irreproducibility)。奖励欺骗是指模型学会了满足奖励信号而没有真正推理;评估污染是指基准测试数据泄露到训练集中;不可复现性是指无法复制训练过程。Provenir 提供了诸如飞行记录器、奖励欺骗检测器、污染检查器…
-
NVIDIA Nemotron 3 Nano Omni 揭晓;Hugging Face 探索参数同步
NVIDIA 推出了 Nemotron 3 Nano Omni,这是一款专为文档、语音和视频智能体设计的多模态智能模型。该新模型支持长上下文窗口,增强了其跨多种模态的能力。此外,Hugging Face 正在通过其 HubBucket 项目探索高效的参数同步方法,旨在传输万亿级别的 Transformer 强化学习参数。另外,Reachy Mini 机器人因其完全本地化运行而受到关注。
-
LLM 微调框架:Unsloth、Axolotl、TRL 和 LLaMA-Factory 比较
对四个流行的 LLM 微调框架——Unsloth、Axolotl、TRL 和 LLaMA-Factory——的比较,重点介绍了它们在优化速度、显存使用和多 GPU 扩展性方面的不同方法。Unsloth 专注于内核级优化,通过重写 Triton 内核实现显著的加速。Axolotl 强调并行策略,并借鉴了 Unsloth 的灵感,集成了自定义内核。TRL 作为 trainer API 的参考实现,提供了各种内存和速度优化。LLaMA-Fa…
-
Hugging Face 重点介绍 TRL v1.0、Hcompany 的 HoloTab 和 IBM 的 Granite 4.1
Hugging Face 正在重点介绍几项新的 AI 进展。Transformer Reinforcement Learning (TRL) 发布了 1.0 版本,这是一个用于训练后适应的库。此外,Hcompany 推出了 AI 浏览器伴侣 HoloTab。IBM 也详细介绍了其 Granite 4.1 LLM 的构建。
-
IBM、NVIDIA发布新的多模态AI模型;Hugging Face详解参数同步
IBM发布了Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态智能模型。NVIDIA推出了Nemotron 3 Nano Omni,这是一款支持长上下文多模态智能,适用于文档、语音和视频代理的模型。此外,Hugging Face详细介绍了一种通过Transformer强化学习的增量权重同步方法,用于在HubBucket中传输一万亿个参数。
-
新工具 TrainSafe 可捕获语言模型微调错误
一款名为 TrainSafe 的新开源工具已被开发出来,用于解决语言模型微调过程中遇到的问题。该工具的创建源于开发者在对阿拉伯语进行微调时,模型意外生成中文文本的经历,这表明低损失指标并不能保证训练成功。TrainSafe 可与 HuggingFace 和 TRL 管道集成,在每个评估检查点执行语言漂移、输出长度、重复、提示回显和格式一致性检查。如果模型的性能下降到设定的阈值以下,TrainSafe 可以停止训练过程并识别最后一个稳定检查点。
-
Hugging Face发布TRL v1.0和RapidFire AI以加速模型训练
Hugging Face发布了TRL v1.0,这是一个用于后训练强化学习的库。一项相关公告强调了RapidFire AI,这是一种可将TRL微调速度提高多达20倍的方法。这些进展旨在提高AI模型训练的效率和适应性。
-
IBM、NVIDIA发布多模态模型;Hugging Face详解参数传输
IBM发布了Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态智能模型。NVIDIA推出了Nemotron 3 Nano Omni,这是一款适用于文档、语音和视频代理的长上下文多模态智能模型。此外,Hugging Face详细介绍了一种在hub buckets中传输一万亿参数的方法,重点关注TRL内的增量权重同步。
-
Nexus Labs 代理评估掩盖了关键客户群体的14点回归
Nexus Labs 的一个微调团队发现,他们对一个 AI 代理的聚合评估分数具有误导性,掩盖了一个特定客户群体显著的性能下降。尽管总体通过率保持在稳定的 87%,但一个客户的成功率却从 91% 下降了 14 个百分点,降至 77%。为解决此问题,该团队实施了一种新的评估策略,该策略按客户群体对结果进行分层,并根据表现最差的细分群体而不是平均值来决定部署。
-
NVIDIA 的 X-Token 支持 AI 模型的跨分词器知识蒸馏
NVIDIA 研究人员开发了 X-Token,一种新颖的知识蒸馏方法,允许小型 AI 模型从大型、不兼容的教师模型中学习。与以往在处理不同分词器时遇到困难的方法不同,X-Token 使用动态规划进行跨度对齐,并使用投影矩阵映射分词器分布。该方法克服了现有技术(如 GOLD)在处理碎片化文本和保留对齐信号方面的局限性,从而提高了在 GSM8k 等任务上的性能。
-
Nemotron-Labs 探索扩散模型以加速LLM推理
NVIDIA的Nemotron-Labs正在探索用于文本生成的扩散模型,目标是显著提高推理速度,这将有利于本地LLM部署。同时,Hugging Face的TRL库引入了Delta Weight Sync,一种通过仅传输权重差异来高效管理和更新海量模型的方法,这对于不断增长的开放权重模型生态系统至关重要。
-
Nexus Labs 通过在单个 Llama 3.1 模型上服务 40 个 LoRA 适配器来降低成本
Nexus Labs 开发了一种经济高效的方法,可以在单个基础模型上服务多个 LoRA 适配器,从而显著降低基础设施成本。通过利用 vLLM 的多 LoRA 服务功能,他们将 40 个客户特定的适配器整合到两个 A100 GPU 上,将月成本从估计的 24,000 美元削减到一小部分。虽然这种方法会带来少量的延迟成本,并且需要仔细评估以确保输出一致性,但对于满足不同客户需求的企业部署来说,它被证明非常高效。
-
Hugging Face 更新 TRL 库,IBM 发布 Granite 4.0 Vision
Hugging Face 发布了其 TRL 库的更新,引入了 TRL v1.0 和一项新的 RapidFire AI 功能,可将训练速度提高 20 倍。此外,IBM 推出了 Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态模型。