PulseAugur
中
实时 07:39:33
实体 Qwen3.6 35B

Qwen3.6 35B

PulseAugur coverage of Qwen3.6 35B — every cluster mentioning Qwen3.6 35B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 34 条
  1. TOOL · CL_279330 ·

    Qwen3.6 35B 模型在双 4060Ti GPU 上运行,性能超越基准测试

    一位用户已成功在两块 NVIDIA 4060Ti 显卡上运行了 Qwen3.6 35B 模型,其性能超越了 'Abliterated' 基准测试。该配置展示了消费级硬件处理大型语言模型的能力,为本地 AI 部署提供了实际示例。

  2. COMMENTARY · CL_257481 ·

    用户寻求关于 Apple Silicon 与 GPU 硬件用于本地 AI 模型的建议

    一位 Reddit 用户正在寻求关于运行本地 AI 模型硬件的建议,正在权衡 Apple Silicon MacBook 和配备独立 GPU 的定制 PC 之间的选择。他们目前使用的 M2 Max MacBook Pro 配备 32GB 内存,即使尝试运行 Qwen3.6 35b 等模型时,在提示处理和 token 生成速度方面也遇到了缓慢的问题。该用户正在寻找能够以良好速度运行最强大模型以进行代理工作的硬件,预算约为 €1500-€3500。

  3. COMMENTARY · CL_241415 ·

    本地LLM争论:小型智能模型 vs. 高效大型模型

    本地大型语言模型(LLMs)的未来正在被讨论,重点是优化将导致更小、能力更强的模型,还是更高效的大型模型。一位用户分享了在CPU上运行模型的经验,指出像MiniCPM5 2B这样的小型模型尽管处理速度更快,但在准确性方面却表现不佳。相比之下,像Qwen3.6 35B这样的大型模型虽然速度较慢,但提供了显著更好的结果,这表明大型模型的效率可能是本地部署的关键。

  4. MEME · CL_232274 ·

    用户讨论Qwen模型在agent编码中的最佳角色分配

    一位Reddit用户正在寻求关于如何最好地利用两个Qwen模型(Qwen3.6 27B和Qwen3.6 35B)来执行agent编码任务的建议。他们正在两台独立的PC上并行运行这些模型,并希望了解考虑到规划、文档、代码编写和测试等功能,每个模型的最优角色分配。

  5. TOOL · CL_227089 ·

    DAMP新技术大幅降低LLM内存使用并提升速度

    研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…

  6. RESEARCH · CL_222870 ·

    自编排脚手架提升大型语言模型编码性能

    一篇新研究论文探讨了用于改进大型语言模型(LLM)编码性能的管理器-工作者脚手架的有效性。研究发现,这种使用共享文件系统工作区的自编排技术,在各种模型上提供了真实但有条件的益处。虽然它显著提升了 Qwen3.8-27B 和 Kimi-K3 等一些模型的性能,但对于 Qwen3.6-35B 等其他模型,其影响微乎其微或为负面。研究表明,与仅仅使用更大的模型相比,这种脚手架可以更具成本效益地实现高准确性,其机制如上下文管理和问题分解有助于提升。

  7. TOOL · CL_214400 ·

    NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍

    一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。

  8. RESEARCH · CL_210838 ·

    新基准使用“马骑自行车”提示词测试大语言模型 · 跟踪到2个来源

    发布了一个新的基准测试,旨在取代旧的、不太相关的测试。该基准测试使用一个包含“马骑自行车,背景有骆驼”的提示词来评估各种语言模型。尽管提示词有拼写错误,但仍被用来比较 Qwen3.8-27b、Sol 5.6 和 Qwen3.6-35B 等模型。

  9. MEME · CL_202947 ·

    新词“vibeslop”描述有趣的、无用的AI项目

    “vibeslop”一词出现在r/LocalLLaMA子版块,用来形容使用本地AI模型创建的、可随意展示但没有实际用途的一次性有趣项目。例如,一个纯CSS的3D引擎、一个滑板平台游戏和一个吃豆人克隆游戏,这些都由各种Qwen模型生成或受其启发。

  10. TOOL · CL_202562 ·

    Gemma4:31b在本地AI模型基准测试中领先,揭示测试设计缺陷 · 跟踪1个来源

    对五个本地AI模型进行的自行测试显示,Gemma4:31b表现最佳,得分为160分中的145分,其次是Qwen3.8-27b,得分为139分。研究指出,一些模型得分较低,例如Muse-Glimmer-30b、Qwen3.6:35b和Qwen3-coder-30b,并非由于智力不足,而是提示词不匹配、响应不完整、占位符答案或在遵循泰语指令方面存在困难。创建者开发了一个新的“高级”基准来更好地区分高性能模型,因为标准基准已变得不那么有效。

  11. FRONTIER RELEASE · CL_194614 ·

    NVIDIA 发布 Nemotron 3.5 Lightning 以实现高效的代理式 AI

    NVIDIA 推出了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的混合专家模型,专为高效的代理式 AI 工作负载而设计。与同等规模的模型相比,该模型提供了高达 4 倍的输出速度和 30% 的任务完成速度提升,并拥有 100 万个 token 的上下文窗口。随同该模型一起发布的还有 NeMo Switchyard,这是一个用于代理工具内智能路由的开源库,能够将请求定向到最合适的模型。Nemotron 3.…

  12. RESEARCH · CL_187906 ·

    llama.cpp PR 提升 Intel GPU 和 x86 CPU 性能

    llama.cpp 项目的一个拉取请求(PR)为量化 KV 缓存解码带来了显著的性能提升。一项更改针对 Intel Battlemage GPU,通过 SYCL 内核切换,在长上下文长度下实现了高达 169% 的解码速度提升。另一项优化侧重于 x86 CPU,为 Q2_0 量化实现了一个 VNNI 路径,解码性能提升了 3-3.6 倍。尽管这些改进在基准测试中显示出有希望的结果,但它们目前仍处于开放的拉取请求状态,需要在各种硬件配置上…

  13. TOOL · CL_181840 ·

    llama.cpp PR 将采样移至 GPU 以提升推理速度

    llama.cpp 的一项新合并请求旨在通过将采样操作从 CPU 移至 GPU 来提高推理速度。此更改使 Qwen3.6:35b 模型在 RTX 5090 上的每秒 token 数提高了约 8%,在 Tesla P40 上提高了 4%。性能提升归因于减少了 CPU-GPU 数据传输的开销,这在内存带宽更高的中高端 GPU 上更为明显。

  14. TOOL · CL_175509 ·

    用户使用 Qwen 微调 Mistral AI 模型以进行电子邮件分类

    一位用户使用 Mistral AI 的模型和 n8n 进行自动化创建了一个电子邮件分类器。该系统由于 Mistral 的错误而由用户进行了微调,它利用 Qwen3.6-35B 将电子邮件分类到存档、垃圾邮件或广告邮件文件夹。它包括一个在最终分类前对可疑电子邮件进行网络搜索的功能,整个过程大约需要 10 分钟。

  15. COMMENTARY · CL_153538 ·

    用户寻求硬件建议以加速 Qwen3.6 35B 模型推理

    一位Reddit用户正在寻求硬件配置建议,以期在使用Qwen3.6 35B模型时获得高推理速度。他们目前在AMD RX6600XT和Ryzen 7 5700X的配置下,预填充速度约为270-300 token/秒,解码速度约为30 token/秒。用户指出,现有的在线基准测试对其硬件而言并不准确,因此正在寻求已实现更快性能的其他用户的建议,目标是达到1000+ token/秒的预填充和100+ token/秒的解码速度。

  16. COMMENTARY · CL_151299 ·

    Qwen3.6 35B KV 缓存量化权衡的讨论

    在 r/LocalLLaMA 子论坛上的一场讨论,探讨了对 Qwen3.6 35B 模型进行 KV 缓存量化的权衡。用户正在争论是否将量化级别降低到 Q8 以下是有益的,同时考虑了对性能和内存占用的显著影响。

  17. COMMENTARY · CL_141891 ·

    AI 爱好者寻求 GPU 升级建议以运行更大的本地模型

    一位用户在 r/LocalLLaMA 子版块上寻求建议,希望突破其当前 NVIDIA GeForce RTX 4080 显存的限制,以扩展本地 AI 模型的能力。他们正在考虑添加一块经济实惠的二手 GPU,例如 2070 或 3060,来处理像 Qwen3.6 35B 和 Gemma 这样更大、更耗内存的模型。主要担忧是这种设置是否能有效提升性能,还是会与现有的 4080 造成瓶颈。

  18. COMMENTARY · CL_140497 ·

    LLM 用户讨论 20GB 显存和 64GB 内存配置的最佳模型

    一位 r/LocalLLaMA 子版块的用户正在为其特定的硬件配置寻求建议,该配置包括一台拥有 64GB DDR5 内存和外接 20GB 显存 GPU 的笔记本电脑。他们发现 Qwen3.6 35B A3B 模型运行良好,支持 CPU 卸载和长上下文。用户正在询问是否有其他混合专家(MoE)模型或密集模型能在类似配置上表现良好,特别是用于本地编码代理任务。

  19. TOOL · CL_157967 ·

    Hugging Face 发布了新的未审查版 Qwen3.6-35B 模型

    一个名为 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF 的新版未审查 Qwen3.6-35B 模型已在 Hugging Face 上发布。该模型旨在兼容各种推理库和应用程序,包括 llama-cpp-python、llama.cpp、vLLM 和 Ollama。提供了集成此模型到不同工作流程的说明和代码片段,使用户能够将其在本地或通过云平台运行。

  20. TOOL · CL_137621 ·

    用户在添加第二个 RTX 3060 GPU 后遇到 LLM 加载问题

    一位 r/LocalLLaMA 子版块的用户在添加第二个 RTX 3060 显卡后,在加载大型语言模型时遇到问题。此前,使用单个 3060 时,用户可以加载 Qwen3.6 27B、Qwen3.6 35B 和 Qwen3.5 122B 等模型并进行 CPU 卸载。然而,在安装第二个显卡后,只有密集模型能按预期加载,而 35B 模型仅加载了一次,122B 模型现在完全无法加载。用户正在寻求有关配置更改或故障排除步骤的建议,以解决此加载问题。