Qwen 3.5-4B
PulseAugur coverage of Qwen 3.5-4B — every cluster mentioning Qwen 3.5-4B across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究:训练时长影响大型语言模型合并效果
一篇新的研究论文探讨了专家训练时长对将多个专家模型合并成一个更强大的大型语言模型的效果的影响。该研究挑战了在模型达到最佳验证损失时进行合并的标准做法,发现某些合并方法,特别是基于稀疏化的方法,在专家训练超出此点后表现更好。这表明应联合考虑训练时长和合并方法的选择以获得最佳结果,这与随机森林中高方差学习者的益处有相似之处。
-
用户在称赞 Gemma4 e2b 后,寻求适用于低配置硬件的小型 AI 模型
r/LocalLLaMA 上的一个 Reddit 用户正在寻找能在性能较弱的硬件上有效运行的小型 AI 模型推荐。该用户分享了 Gemma4 e2b 的积极体验,称赞其速度和输出质量,并将其与 ChatGPT 3.5 甚至可能与 ChatGPT 4 进行了有利的比较。他们还提到了之前对 Qwen 3.5 4b 的积极体验。
-
开发者为小型本地 LLM(如 Qwen)构建代理 Harness
一位开发者创建了一个专为小型本地语言模型设计的代理 Harness,解决了常见的故障模式,如糟糕的工具调用、环境变量验证和状态跟踪。该 Harness 已在 GitHub 上提供,并已成功用于 Qwen 3.5-4B 和 Qwen 3.69B 等模型管理服务器和远程任务。该项目旨在提高这些小型模型在代理应用中的稳定性和性能。
-
Bag of Dims:揭示训练无关的 Transformer 可解释性方法
研究人员开发了一种名为“Bag of Dims”的新方法,该方法实现了 Transformer 模型训练无关的机械可解释性。该方法将 Transformer 隐藏状态内的单个维度视为独立的寄存器,其中维度的符号表示语义内容,其幅度表示置信度。该框架已在语言、视觉和音频领域的各种模型中得到验证,证明仅符号模式就能以高精度预测下一个 token 准确率并检测语义类别。此外,实验表明这些特征具有因果作用,意味着可以通过操纵它们的符号来抑制模…
-
基于浏览器的AI在物理沙盒中控制虚拟手
一个名为Semantic Hand的新AI沙盒允许用户使用自然语言提示在浏览器环境中控制虚拟手。该系统利用Nemotron 3 Nano 4B或Qwen 3.5-4B等本地AI模型,通过Transformers.js和WebGPU运行,来解释用户命令并将其转化为虚拟手的物理动作。遇到的挑战包括优化系统提示以防止幻觉,并确保AI能够正确考虑物体形状和物理特性,而不仅仅是基于点的交互。
-
新的“Bag of Dims”方法实现了无需训练的 Transformer 可解释性
研究人员开发了一种名为“Bag of Dims”的新颖方法,该方法能够对 Transformer 模型进行无需训练的机械可解释性分析。该方法利用 Transformer 隐藏状态中各个维度的符号模式来编码语义内容,其功能类似于独立的二进制寄存器。在 Qwen 3.5-4B、Gemma 3-4B 和 Mistral 7B 等多个模型系列上的实验表明,仅凭这些符号模式就具有高度预测性,在下一个词预测中达到了很高的准确率,并能够在没有任何额…
-
Unsloth 对决 Bartowski:Qwen 模型 MTP 性能基准测试
一位 Reddit r/LocalLLaMA 用户对 Unsloth 和 Bartowski 实现 MTP(多任务提示)技术在 Qwen 3.5-4B 和 9B 模型上的性能进行了比较。比较重点关注了不同量化级别(Q4_0、IQ4_NL、Q4_1、Q8_0)下的 VRAM 使用量和每秒 token 数。虽然两种实现都显示出相似的性能,但在某些测试中,Unsloth 通常使用的 VRAM 略少,吞吐量略高。
-
新研究推进机器人和LLM的策略优化
研究人员引入了几种新方法来增强强化学习中的策略优化,特别是针对涉及机器人和大型语言模型(LLM)的复杂任务。MODIP旨在通过使用世界模型来指导适应,从而高效地微调机器人学习中的扩散策略,与标准的模仿学习相比,提高了稳定性和性能。N-GRPO和T2-GRPO分别侧重于通过采用新颖的嵌入层混合和多视域奖励策略来改进LLM在数学推理和护理代理等任务中的探索和奖励分配。此外,CATPO和GenPO++通过改进基于树的方法和生成策略来提高训练…