Qwen 3.5 35B
PulseAugur coverage of Qwen 3.5 35B — every cluster mentioning Qwen 3.5 35B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Qwen 3.5 35B模型在Radeon 7600 GPU上以18 tokens/秒的速度运行
Reddit的r/LocalLLaMA子版块的一位用户分享了他在Radeon 7600 GPU上运行Qwen 3.5 35B模型的经验。他们在Ubuntu系统上使用llama.cpp的特定设置,实现了每秒18个token的速度,突显了该模型在消费级硬件上的性能。
-
Qwen 3.5 35B 模型在 300 美元的笔记本电脑上以 10.33 t/s 的速度运行
Reddit 的 r/LocalLLaMA 子版块的一位用户详细介绍了他们在经济型笔记本电脑上运行 Qwen 3.5 35B 模型的体验。他们在配备 40GB RAM 的 300 美元联想 Ideapad Slim 3i 上实现了每秒 10.33 个 token 的推理速度。该设置涉及特定的优化以及使用 ik_llama.cpp 推理后端。
-
Qwen 3.5-35B 有效地玩转 Dungeon Crawl Stone Soup
Qwen 3.5-35B 模型(非 MTP 版本)已证明能够有效地玩开源 Roguelike 游戏 Dungeon Crawl Stone Soup (DCSS)。虽然 Qwen 的 MTP 版本在工具调用方面存在问题,但标准版本表现良好,即使是较小的量化模型也是如此。这种能力正被探索作为 LLM 在传统基准测试之外的性能基准,该模型成功地导航游戏关卡、击败敌人和管理库存。
-
开发者每日路由 200 多个 LLM 调用跨越五个模型以降低成本
一位开发者详细介绍了一种管理 AI 推理成本的策略,即将任务路由到能够满足质量要求的最经济实惠的模型。这种被称为“推理套利”的方法涉及一个多模型堆栈,包括将 Claude Sonnet 作为日常驱动程序,Opus 用于复杂推理,OpenAI 的 Codex 用于交叉检查,Gemini Flash 用于研究,以及本地部署的 Qwen 模型用于敏感数据处理。作者对 15 个模型进行的 38 项任务基准测试显示,大多数任务不需要最昂贵的模型…
-
Qwen-3.5 35B 模型在 llama.cpp 上运行
Hugging Face 分享了一个演示,展示了 Qwen-3.5 35B 模型如何在流行的推理引擎 llama.cpp 上高效运行。该模型通过 'pi' 工具进行部署,展示了其在实际应用中的能力。这突显了持续优化大型语言模型以实现更广泛的可访问性和在消费级硬件上使用的努力。