LoRA adapters
PulseAugur coverage of LoRA adapters — every cluster mentioning LoRA adapters across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究发现:大型语言模型过度使用修辞性自我纠正
一篇新的研究论文识别出一种名为“矫饰”(epanorthosis)或自我纠正的修辞手法,大型语言模型系统性地过度使用了它。研究认为,这种过度使用源于包含大量宣传内容且偏好强调性措辞的强化学习技术的训练数据。研究人员提出了一个“矫饰指数”来衡量这种倾向,并探索了包括轻量级适配器和指令调优在内的缓解策略,旨在根据不同体裁的人类修辞风格来校准模型输出。
-
新的TOPL方法通过预测token正确性来提高忠实生成
研究人员引入了一种新颖的训练范式——Token-Level Off-Policy Labeling (TOPL),它将训练后任务重构为token级别正确性预测任务。该方法指导模型区分响应中正确和不正确的token,从而在不直接训练off-policy token的情况下提高生成质量。在文档摘要和机器翻译任务上的实验表明,TOPL在分布外泛化方面具有有效性,并且能够跨不同的忠实生成任务进行迁移。
-
Gemma-3 通过 GRPO 和 LoRA 增强数学推理能力
本教程详细介绍了如何训练 Gemma-3 模型,利用 GSM8K 数据集来提高其结构化数学推理能力。该过程包括使用 Tunix、JAX 和 LoRA 适配器等工具设置环境,然后应用具有自定义奖励函数的 Grouped-Sampled Policy Optimization (GRPO)。训练侧重于仅优化适配器权重,使工作流程足够高效,可在单个加速器上运行。
-
软提示蒸馏增强了设备端大模型的安全性
研究人员开发了一种新方法,可以使大型语言模型(LLM)在资源有限的设备上使用时更安全、更高效。该技术结合使用“软提示”和蒸馏技术,将安全行为从一个守护模型转移到主LLM。与其他的参数高效方法相比,这种方法显著改善了安全性和可用性的权衡,在推理过程中仅需要极少的额外内存和计算资源。