Qwen 35B A3B
PulseAugur coverage of Qwen 35B A3B — every cluster mentioning Qwen 35B A3B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
llama.cpp 为 Qwen 35B 等 MoE 模型添加 MMVQ 优化
一项提交给 llama.cpp 项目的拉取请求为专家混合(MoE)模型引入了优化,特别是针对 Qwen 35B A3B 等架构。这项名为 MMVQ 的增强功能旨在通过在 CUDA 框架内融合共享专家来提高这些模型的速度。该更改由用户 am17an 提交,是优化本地大型语言模型性能的持续努力的一部分。
-
爱好者用笔记本和GPU打造“最愚蠢”的AI台式机
一位在Reddit上被称为Alternative-Panic69的印度科技爱好者,试图通过M.2插槽将一块AMD Radeon RX 7900 XT GPU连接到一台联想Yoga笔记本电脑,来构建一个本地AI聊天机器人系统。这种非常规的设置,包括外部电源和用于启动的USB SSD,最初在基准测试中表现良好,但最终在运行Qwen 35B和GLM-4.7 Flash等大型语言模型时遇到了困难。主要的瓶颈在于笔记本电脑有限的内存,当内存耗尽…
-
Qwen和Gemma的tokenization差异影响代码和语言任务
一位r/LocalLLaMA用户观察到Qwen 35B A3B和Gemma 26B A4B在tokenizing代码方面存在显著差异。Qwen将一段330行的HTML/JS代码片段处理成1609个token,而Gemma将相同的输入tokenized为4258个token。这种差异可能解释了Qwen在代码任务上的优势以及Gemma在语言处理方面的优势,因为Qwen似乎将代码视为一种不同的输入类型,而Gemma则像处理自然语言一样将其分…