实体
Qwen3-30B-A3B-Instruct
Qwen3-30B-A3B-Instruct
PulseAugur coverage of Qwen3-30B-A3B-Instruct — every cluster mentioning Qwen3-30B-A3B-Instruct across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新技术循环 Transformer 层以提升模型性能
研究人员开发了一种名为训练免费循环 Transformer 的新颖技术,该技术可以在不进行任何额外训练或架构修改的情况下增强现有冻结语言模型的性能。该方法在推理时应用一个轻量级包装器,将连续的层块循环起来,将其视为常微分方程近似的改进,而不是直接更新。该方法已在不同模型系列中展示了性能提升,包括在 Qwen3 和 Moonlight 等模型上,在 MMLU-Pro、CommonsenseQA 和 OpenBookQA 等基准测试上取得…
-
新方法在不牺牲稳定性的情况下增强了LLM推理的多样性
研究人员推出了一种名为Expert-Sample的新型无训练方法,旨在增强细粒度混合专家(MoE)模型的性能。该技术通过分析MoE层的路由分数来解决测试时扩展的性能与多样性和稳定性之间的权衡问题。Expert-Sample利用了MoE路由器表现出高置信度“确定头”和低置信度“不确定尾”的观察结果,选择性地将随机性注入后者,以提高生成多样性而不损害输出稳定性。该方法在Qwen3-30B-A3B-Instruct等模型上的评估显示,在各种…