LoRA adapters
PulseAugur coverage of LoRA adapters — every cluster mentioning LoRA adapters across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
MLLMs adapted for electron microscopy segmentation prompts
研究人员探索了使用开放权重多模态大语言模型(MLLMs)为电子显微镜分割生成点提示。通过在现有数据集上使用LoRA适配器对Qwen3-VL等模型进行微调,他们在分割精度上取得了显著的改进,其中Qwen3-VL的AP50得分达到了0.736。虽然这种方法在将语言指令与掩码解码联系起来方面显示出潜力,但在特定任务上,监督式质心热图检测器仍然优于它。
-
新的 Credal LLM 改进了不确定性表示并减少了幻觉
研究人员引入了 Credal 大型语言模型 (CLLM),以解决 LLM 生成自信但错误的答案的问题。与使用单一预测分布的标准 LLM 不同,CLLM 采用 LoRA 适配器集成来创建 Credal 集。该集合暴露了一系列合理的分布,从而可以推导出更好地反映不确定性的承诺分数。所提出的方法,Credal Token Commitment (CTC) 和 Semantic Commitment Consistency (SCC),在 G…
-
分析称:开放权重的LLM如同二进制文件,而非可修补代码
一篇文章认为,开放权重的语言模型,尽管看起来如此,但其功能更像是供应商提供的二进制文件,而不是可修补的依赖项。这种区别至关重要,因为用户无法像传统的软件库那样直接修改或修复这些模型的预训练。相反,真正的
-
研究发现:大型语言模型过度使用修辞性自我纠正
一篇新的研究论文识别出一种名为“矫饰”(epanorthosis)或自我纠正的修辞手法,大型语言模型系统性地过度使用了它。研究认为,这种过度使用源于包含大量宣传内容且偏好强调性措辞的强化学习技术的训练数据。研究人员提出了一个“矫饰指数”来衡量这种倾向,并探索了包括轻量级适配器和指令调优在内的缓解策略,旨在根据不同体裁的人类修辞风格来校准模型输出。
-
新的TOPL方法通过预测token正确性来提高忠实生成
研究人员引入了一种新颖的训练范式——Token-Level Off-Policy Labeling (TOPL),它将训练后任务重构为token级别正确性预测任务。该方法指导模型区分响应中正确和不正确的token,从而在不直接训练off-policy token的情况下提高生成质量。在文档摘要和机器翻译任务上的实验表明,TOPL在分布外泛化方面具有有效性,并且能够跨不同的忠实生成任务进行迁移。
-
Gemma-3 通过 GRPO 和 LoRA 增强数学推理能力
本教程详细介绍了如何训练 Gemma-3 模型,利用 GSM8K 数据集来提高其结构化数学推理能力。该过程包括使用 Tunix、JAX 和 LoRA 适配器等工具设置环境,然后应用具有自定义奖励函数的 Grouped-Sampled Policy Optimization (GRPO)。训练侧重于仅优化适配器权重,使工作流程足够高效,可在单个加速器上运行。
-
软提示蒸馏增强了设备端大模型的安全性
研究人员开发了一种新方法,可以使大型语言模型(LLM)在资源有限的设备上使用时更安全、更高效。该技术结合使用“软提示”和蒸馏技术,将安全行为从一个守护模型转移到主LLM。与其他的参数高效方法相比,这种方法显著改善了安全性和可用性的权衡,在推理过程中仅需要极少的额外内存和计算资源。