PulseAugur
实时 17:36:35
实体 Qwen3-1.7B-Base

Qwen3-1.7B-Base

PulseAugur coverage of Qwen3-1.7B-Base — every cluster mentioning Qwen3-1.7B-Base across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_252114 ·

    新方法增强AI策略优化以应对复杂任务 · 跟踪2个来源

    研究人员开发了改进强化学习策略的新方法,特别是在数学推理等复杂任务中。一种方法HISPO引入了一种段级策略优化技术,该技术将显著性权重分配给响应的连续段,在token级和序列级方法之间提供了一个中间纠正单元。另一项开发Adversarial Importance Sampling (Advis) 专注于通过优化可验证的最坏情况回报,而无需额外的环境交互或辅助网络,来保护深度强化学习策略免受输入扰动的影响。这两种方法都旨在提高AI模型在…

  2. TOOL · CL_156456 ·

    新的蒸馏方法通过软提示高效训练大语言模型

    研究人员开发了一种名为“通过软提示特权上下文进行多任务在线策略蒸馏”(“该方法”)的新方法来训练大语言模型。该技术使用一个仅通过可学习的软提示与学生模型不同的教师模型,从而在不改变学生模型核心参数的情况下实现高效的知识转移。多任务变体使单个学生模型能够同时从多个教师那里学习,从而提高在科学、工具使用、生物学和数学等各种任务上的性能。