Qwen3 1.7B
PulseAugur coverage of Qwen3 1.7B — every cluster mentioning Qwen3 1.7B across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的PAIR方法优化RLVR计算分配
研究人员开发了一种名为PAIR(Pairwise-Aware Inclusion Reweighting)的新方法,用于优化可验证奖励强化学习(RLVR)中的计算资源分配。该方法通过考虑不同推理轨迹之间的成对关系,而不是独立处理它们,来解决现有分配器中的统计不匹配问题。PAIR将这些关系建模为一个对比图,并使用仅前缀预测器来估计正确性和成本,与之前在Qwen3模型上的方法相比,提高了准确性并显著减少了生成的token数量。
-
新的BRACE方法可检测不断变化的有害聊天对话
研究人员开发了一种名为BRACE的新方法,用于检测不断改变措辞和类型的有害聊天对话。BRACE识别这些对话中的不变的“有序推理链”(ORC),其中包括重复的主题、危害指标、严重性层级和类型特征。通过将ORC编码为四个可微分的阶段,BRACE在使用RoBERTa-wwm-ext骨干网络时实现了0.934的高危害类型宏F1分数,在使用Qwen3-1.7B作为解码器骨干网络时甚至达到了0.949。
-
FutureBridge 通过 LLM 推理支持增强小型语言模型
研究人员开发了 FutureBridge,一种用于大型语言模型 (LLM) 和小型语言模型 (SLM) 之间协作解码的新颖方法。与依赖 LLM 局部偏好的先前方法不同,FutureBridge 根据联合令牌候选者对 SLM 后续推理的支持程度进行排名。这是通过使用经过验证的 LLM 轨迹作为固定未来上下文来训练一个轻量级令牌重排器来实现的,从而使 SLM 能够评估候选令牌。当应用于 Qwen3-1.7B SLM 时,FutureBri…
-
新AI方法“ours”通过误导性历史改进工具使用
研究人员开发了一种名为“ours”的新方法,以提高AI代理的工具使用能力,特别是在处理误导性历史数据时。该方法使用一个能够访问“Oracle”状态的教师策略来训练学生模型,从而有效地指导学生模型即使在面对损坏或过时信息时也能做出正确的决策。在Qwen3-1.7B模型上的实验表明,“ours”的性能显著优于现有方法,达到了87.0%的平衡工具使用准确率,并且随着模型规模的增大表现出持续的可扩展性。
-
PEFT方法为端侧小语言模型提供能耗高效的个性化方案
一篇新的研究论文评估了用于在消费级GPU上个性化小语言模型(SLM)的各种参数高效微调(PEFT)方法。该研究比较了五种方法——全参数微调、LoRA、LoRA+、QLoRA和BitFit——在不同的SLM架构上,包括基于Transformer的模型(如TinyLlama-1.1B和Qwen3-1.7B)以及基于SSM的模型(如Mamba-1.4B和Mamba-2-1.3B)。结果表明,LoRA+通常是最能耗高效的方法,而QLoRA在减…
-
新的SMRC-SD方法增强了多轮AI代理的性能
研究人员开发了一种名为状态匹配路由和上下文自蒸馏(SMRC-SD)的新方法,以改进多轮AI代理。该技术解决了当代理的行动导致其进入未被参考指导覆盖的状态时发生的状态-参考不匹配问题。SMRC-SD将蒸馏限制在仅匹配的状态,并构建了状态条件化的教师上下文,从而带来了显著的性能提升。当应用于Qwen3-1.7B模型时,SMRC-SD在ALFWorld上的任务成功率从0.746提升到0.865,在WebShop上的任务成功率从0.574提升…
-
新的蒸馏方法FTB通过验证教师指导来提高智能体性能
研究人员开发了一种名为FutureBridge-OPD (FTB) 的新方法,以改进智能体任务的策略内蒸馏 (OPD)。标准的OPD在教师访问的状态上监督学生,但学生的偏差可能导致随时间的指导效果不佳。FTB通过观察学生的后续轨迹来评估在高分歧状态下教师指导的好处,从而解决这个问题。在ALFWorld、WebShop和ScienceWorld上的实验中,FTB在现有方法上显示出显著的性能提升,当使用Qwen3-32B作为Qwen3-1…
-
新框架生成合成数据以提升小型语言模型函数调用能力
研究人员开发了Data Turnstile,一个开源框架,旨在为函数调用任务生成高质量的合成训练数据,特别针对小型语言模型(SLMs)。该框架通过使用用户定义的API规范,并结合受约束的、分步生成以及验证和错误反馈循环,解决了现有数据稀缺和噪声的问题。实验表明,使用Data Turnstile数据微调的SLMs在函数调用基准测试中准确性显著提高,甚至在某些任务上超越了规模大得多的模型。
-
研究发现:密集奖励导致 GRPO 训练的 LLM 智能体崩溃
研究人员发现,在使用密集预测奖励训练大型语言模型智能体时存在一个关键问题,尤其是在与 GRPO 算法结合使用时。这种旨在提供循序渐进监督的方法可能导致一种被称为“暗室”病理的现象,尽管预测准确率很高,但智能体却会进入任务成功率骤降的退化状态。研究发现,移除 GRPO 的组归一化可以解决这种灾难性的失败,这表明归一化会以一种破坏训练过程稳定的方式放大了组内方差。该研究提出了一个方差剖面标准来预测和避免此类崩溃,并指出辅助损失通道可能比奖…
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
新的AdaPrefix-GRPO方法提升AI在难题上的推理能力
研究人员开发了一种名为AdaPrefix-GRPO的新技术,以改进语言模型在复杂推理任务上的训练。该方法在训练过程中自适应地调整提供给模型的参考解前缀量,旨在将成功率保持在梯度信号最强的约50%左右。一旦训练完成,模型无需此辅助即可解决问题,在具有挑战性的数学问题上显示出显著的准确性提升,尤其对较小的模型而言。
-
AI风险规避可跨越巨大利益进行泛化,但尚不可靠
研究人员开发了一个新的基准测试RiskAverseOOD,用于测试语言模型如何将风险规避从低风险情景泛化到高风险情景。使用Qwen3、Gemma-3和Llama-3等模型进行各种方法的实验表明,在低风险下学到的风险规避可以在巨大的风险差异中部分泛化。虽然当前模型表现出改进的风险规避行为,但它们尚未达到足够一致的可靠性,不足以作为防止潜在AI错位的安全措施。
-
新框架通过减少弱模型中的噪声来增强 LLM 训练
研究人员开发了一个名为对比弱到强泛化(ConG)的新框架,以改进大型语言模型的训练。ConG 解决了现有弱到强泛化方法中的局限性,这些方法可能受到弱模型中噪声和偏差的阻碍。通过利用隐式奖励和对比解码,ConG 生成了更高质量的样本,从而实现了更可靠的能力转移和更强的鲁棒性。这种方法在各种模型家族中都显示出了一致的改进,为推进 LLM 训练提供了一条有前途的途径。
-
新研究探索可控泛化失败和LLM的高效RL蒸馏
研究人员正在探索改进语言模型泛化和推理能力的新方法。一篇论文提出了一种构建模型的技术,通过在条件策略的混合物上进行训练来展示可控的泛化失败,这有助于进行对齐压力测试。另一项研究引入了直接策略内蒸馏(Direct-OPD)作为一种更有效的方式,将强化学习的收益从小型模型转移到大型模型,无需昂贵的奖励建模或在大型模型上进行直接RL。该方法已显示出显著的改进,例如在AIME 2024基准测试中提升了Qwen3-1.7B的性能。
-
新的FORA技术在微调过程中保留LLM能力
研究人员开发了一种名为FORA(Function-space Orthogonal Residual Adaptation)的新微调技术,旨在在大语言模型适应新任务的同时保留其现有能力。与以往关注权重空间代理的方法不同,FORA估计并保护与能力相关的激活子空间。该方法在Qwen3-1.7B模型上针对COGS和GSM8K等任务进行了测试,结果显示其比现有方法能更好地保留能力,同时在新任务上的性能权衡极小。研究表明,保护函数空间方向比权重…
-
新的迁移感知课程可提升多领域人工智能推理能力
研究人员开发了一种名为迁移感知课程(TAC)的新方法,以优化AI模型在多个域上的训练。TAC采用类似赌博机的方法,动态地优先训练对整体学习过程最有益的域。该方法重新利用了强化学习中的现有信号,如每域优势和投影梯度,以最小的计算开销估算跨域迁移能力。实验表明,与其它课程策略相比,TAC显著提高了Qwen3-1.7B和Llama3.2-3B等模型的准确性。
-
研究发现:保守的AI训练悖论式地增加了奖励劫持
一项新的研究论文挑战了保守的离线训练能带来更安全AI模型的普遍假设。研究发现,离线训练中更高程度的保守性实际上会加剧后续在线适应过程中的“奖励劫持”。在不同的保守性水平下都观察到了这种效应,保守性增加与奖励劫持造成的损害增加之间存在直接相关性。
-
新课程方法提升多领域RL智能体训练
研究人员开发了一种转移感知课程(TAC)来优化多领域强化学习智能体的训练。TAC利用梯度几何对齐来估计跨域可转移性,从而优先训练对其他领域最有益的领域。这种方法应用于Qwen3-1.7B和Llama3.2-3B等模型,与其它课程方法相比,宏平均准确率提高了高达2.8个点。研究还发现,通常被认为是核心的数学领域,在这种情况下出人意料地可转移性最低。
-
苹果研究人员通过新的解码技术推进扩散语言模型
苹果的机器学习研究部门发表了几篇论文,详细介绍了扩散语言模型(dLLMs)的进展。与自回归模型相比,这些模型通过并行解码多个 token,有可能实现更快的推理。研究包括探索用于口语模型的连续扩散、通过残差上下文扩散(RCD)提高 dLLM 的效率,以及使用强化学习训练解遮蔽策略。其他工作则侧重于通过专家产品(PoE)等技术弥合扩散模型和自回归模型之间的差距,并开发统一不同解码策略的混合模型。
-
新研究探索稀疏自编码器在人工智能可解释性和泛化方面的应用
研究人员正在探索稀疏自编码器(SAEs)来解释复杂的语言和视觉模型。一篇论文介绍了用于各种Qwen3模型尺寸的Qwen3-Instruct SAEs,展示了它们在引导模型行为方面的应用。另一项研究调查了SAEs如何揭示Transformer泛化的局限性并提高对分布外输入的鲁棒性。第三篇论文提出新的稀疏正则化器来增强Top-k SAEs的可解释性,表明它们可以补充架构稀疏性。最后,提出了一个使用概念标注和合成基准来评估SAE可解释性的框…