Qwen3.6 35B
PulseAugur coverage of Qwen3.6 35B — every cluster mentioning Qwen3.6 35B across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍
一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。
-
新基准使用“马骑自行车”提示词测试大语言模型 · 跟踪到2个来源
发布了一个新的基准测试,旨在取代旧的、不太相关的测试。该基准测试使用一个包含“马骑自行车,背景有骆驼”的提示词来评估各种语言模型。尽管提示词有拼写错误,但仍被用来比较 Qwen3.8-27b、Sol 5.6 和 Qwen3.6-35B 等模型。
-
新词“vibeslop”描述有趣的、无用的AI项目
“vibeslop”一词出现在r/LocalLLaMA子版块,用来形容使用本地AI模型创建的、可随意展示但没有实际用途的一次性有趣项目。例如,一个纯CSS的3D引擎、一个滑板平台游戏和一个吃豆人克隆游戏,这些都由各种Qwen模型生成或受其启发。
-
Gemma4:31b在本地AI模型基准测试中领先,揭示测试设计缺陷 · 跟踪1个来源
对五个本地AI模型进行的自行测试显示,Gemma4:31b表现最佳,得分为160分中的145分,其次是Qwen3.8-27b,得分为139分。研究指出,一些模型得分较低,例如Muse-Glimmer-30b、Qwen3.6:35b和Qwen3-coder-30b,并非由于智力不足,而是提示词不匹配、响应不完整、占位符答案或在遵循泰语指令方面存在困难。创建者开发了一个新的“高级”基准来更好地区分高性能模型,因为标准基准已变得不那么有效。
-
NVIDIA 发布 Nemotron 3.5 Lightning 以实现高效的代理式 AI
NVIDIA 推出了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的混合专家模型,专为高效的代理式 AI 工作负载而设计。与同等规模的模型相比,该模型提供了高达 4 倍的输出速度和 30% 的任务完成速度提升,并拥有 100 万个 token 的上下文窗口。随同该模型一起发布的还有 NeMo Switchyard,这是一个用于代理工具内智能路由的开源库,能够将请求定向到最合适的模型。Nemotron 3.…
-
llama.cpp PR 提升 Intel GPU 和 x86 CPU 性能
llama.cpp 项目的一个拉取请求(PR)为量化 KV 缓存解码带来了显著的性能提升。一项更改针对 Intel Battlemage GPU,通过 SYCL 内核切换,在长上下文长度下实现了高达 169% 的解码速度提升。另一项优化侧重于 x86 CPU,为 Q2_0 量化实现了一个 VNNI 路径,解码性能提升了 3-3.6 倍。尽管这些改进在基准测试中显示出有希望的结果,但它们目前仍处于开放的拉取请求状态,需要在各种硬件配置上…
-
llama.cpp PR 将采样移至 GPU 以提升推理速度
llama.cpp 的一项新合并请求旨在通过将采样操作从 CPU 移至 GPU 来提高推理速度。此更改使 Qwen3.6:35b 模型在 RTX 5090 上的每秒 token 数提高了约 8%,在 Tesla P40 上提高了 4%。性能提升归因于减少了 CPU-GPU 数据传输的开销,这在内存带宽更高的中高端 GPU 上更为明显。
-
用户使用 Qwen 微调 Mistral AI 模型以进行电子邮件分类
一位用户使用 Mistral AI 的模型和 n8n 进行自动化创建了一个电子邮件分类器。该系统由于 Mistral 的错误而由用户进行了微调,它利用 Qwen3.6-35B 将电子邮件分类到存档、垃圾邮件或广告邮件文件夹。它包括一个在最终分类前对可疑电子邮件进行网络搜索的功能,整个过程大约需要 10 分钟。
-
用户寻求硬件建议以加速 Qwen3.6 35B 模型推理
一位Reddit用户正在寻求硬件配置建议,以期在使用Qwen3.6 35B模型时获得高推理速度。他们目前在AMD RX6600XT和Ryzen 7 5700X的配置下,预填充速度约为270-300 token/秒,解码速度约为30 token/秒。用户指出,现有的在线基准测试对其硬件而言并不准确,因此正在寻求已实现更快性能的其他用户的建议,目标是达到1000+ token/秒的预填充和100+ token/秒的解码速度。
-
Qwen3.6 35B KV 缓存量化权衡的讨论
在 r/LocalLLaMA 子论坛上的一场讨论,探讨了对 Qwen3.6 35B 模型进行 KV 缓存量化的权衡。用户正在争论是否将量化级别降低到 Q8 以下是有益的,同时考虑了对性能和内存占用的显著影响。
-
AI 爱好者寻求 GPU 升级建议以运行更大的本地模型
一位用户在 r/LocalLLaMA 子版块上寻求建议,希望突破其当前 NVIDIA GeForce RTX 4080 显存的限制,以扩展本地 AI 模型的能力。他们正在考虑添加一块经济实惠的二手 GPU,例如 2070 或 3060,来处理像 Qwen3.6 35B 和 Gemma 这样更大、更耗内存的模型。主要担忧是这种设置是否能有效提升性能,还是会与现有的 4080 造成瓶颈。
-
LLM 用户讨论 20GB 显存和 64GB 内存配置的最佳模型
一位 r/LocalLLaMA 子版块的用户正在为其特定的硬件配置寻求建议,该配置包括一台拥有 64GB DDR5 内存和外接 20GB 显存 GPU 的笔记本电脑。他们发现 Qwen3.6 35B A3B 模型运行良好,支持 CPU 卸载和长上下文。用户正在询问是否有其他混合专家(MoE)模型或密集模型能在类似配置上表现良好,特别是用于本地编码代理任务。
-
Hugging Face 发布了新的未审查版 Qwen3.6-35B 模型
一个名为 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF 的新版未审查 Qwen3.6-35B 模型已在 Hugging Face 上发布。该模型旨在兼容各种推理库和应用程序,包括 llama-cpp-python、llama.cpp、vLLM 和 Ollama。提供了集成此模型到不同工作流程的说明和代码片段,使用户能够将其在本地或通过云平台运行。
-
用户在添加第二个 RTX 3060 GPU 后遇到 LLM 加载问题
一位 r/LocalLLaMA 子版块的用户在添加第二个 RTX 3060 显卡后,在加载大型语言模型时遇到问题。此前,使用单个 3060 时,用户可以加载 Qwen3.6 27B、Qwen3.6 35B 和 Qwen3.5 122B 等模型并进行 CPU 卸载。然而,在安装第二个显卡后,只有密集模型能按预期加载,而 35B 模型仅加载了一次,122B 模型现在完全无法加载。用户正在寻求有关配置更改或故障排除步骤的建议,以解决此加载问题。
-
LLM 用户寻求关于升级到 40B+ 参数模型以提高速度和知识的建议
r/LocalLLaMA subreddit 上的一位用户正在寻求关于拥有超过 400 亿参数的大型语言模型 (LLM) 的推荐。他们目前使用的是 Qwen3.6 35B,但发现它缺乏通用知识,更像一个执行者而不是助手。用户正在考虑升级到 Qwen3.5 122B,但担心速度问题,因为他们在 Strix Halo 硬件上使用 131k 上下文窗口时,目前能达到大约 30-40 tokens/秒。
-
NVIDIA 在 Hugging Face 上发布新的 Nemotron 和 Qwen AI 模型
NVIDIA 发布了包括 Nemotron-3 Nano 30B A3B 和 Qwen 模型量化版本在内的多个新 AI 模型和检查点。这些主要在 Hugging Face 上发布的版本采用 Apache 2.0 许可,并支持文本、图像和视频等多种输入类型。一些用户已计划在代理工作流中测试和比较这些新的 NVIDIA 模型与现有的 Qwen 版本。
-
将自适应MoE门控后验应用于Qwen3.6-35B,效果有限
研究人员为Qwen3.6-35B模型开发了一种后验自适应专家混合(MoE)门控方法,旨在提高效率而无需重新训练。他们的方法作为llama.cpp的推理时补丁实现,对专家路由权重应用累积概率阈值。在Penn Treebank数据集上的实证结果表明,这种后验方法虽然减少了活动专家的数量,但并未显著提高困惑度,与基线固定k模型相比甚至可能略微降低性能。主要贡献在于为生产推理引擎提供了实际实现,并实证证明了将自适应门控应用于预训练的、固定k模型的局限性。
-
Ornith 35B 与 Gemma4 31B 和 Qwen3.6 35B 进行基准测试
新的语言模型 Ornith 35B 使用 WebBrain 的 frozen browser-agent planner benchmark 与 Gemma4 31B 和 Qwen3.6 35B 进行了基准测试。虽然 Ornith 35B 显示出潜力,并在对齐方面略优于 Qwen3.6 35B,但根据测试结果,Gemma4 31B 仍然是更优的选择。
-
多层MoE缓存被讨论为LLM推理的未来方向
Reddit上的一篇讨论探讨了多层专家混合(MoE)缓存的概念,认为这是MoE模型推理的潜在未来方向。该想法涉及将模型专家策略性地分布在CPU和GPU内存中以优化性能,利用了少数专家占大部分激活的观察结果。PowerInfer和Lidenburg的llama.cpp分支等几个现有实现和研究论文被引用为该方法的示例,该方法旨在提高大型模型的推理速度,尤其是在混合RAM/VRAM设置中。
-
用户批评Hermes Agent的UI和UX缓慢且丑陋
一位Reddit r/LocalLLaMA板块的用户对Hermes Agent的用户界面和用户体验表示不满。尽管它承诺了功能并且其他人报告说它很好,但该用户发现其Web UI的美学设计不吸引人,并且包括TUI在内的整体体验都缓慢而乏味。他们将其与Pi mono Agent进行了对比,后者更快、响应更灵敏,可以更快地识别出故障。该用户正在使用Qwen3.6-35B和Gemma4-26B模型来运行Hermes,并正在寻求有关如何改善其使用体验的建议。