35b a3b
PulseAugur coverage of 35b a3b — every cluster mentioning 35b a3b across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
消费级GPU在122B模型上实现高LLM速度,运行速度达37 t/s
Reddit的r/LocalLLaMA子版块上一位用户分享了在消费级硬件上运行大型语言模型的令人印象深刻的基准测试。他们使用Nvidia RTX 4090和RTX 5060 Ti,并将部分层卸载到64GB系统内存,在350亿参数模型(35b a3b)上实现了每秒206个token。更值得注意的是,在类似条件下,一个1220亿参数模型(barium-122)的运行速度达到了每秒37个token,超出了用户的乐观预期。
-
Reddit 上关于 Qwen 3.6 硬件成本的讨论
一位 Reddit 用户正在寻找运行 Qwen 3.6 模型(特别是 27B 和 35B-A3B 变体)最具成本效益的硬件配置,目标是达到每秒 40 个 token 的性能。该用户已确定了像 RTX 3090 24GB 或 Tesla v100 32GB 这样的潜在硬件,并正在寻找阿里巴巴提出的 2000 美元单 RTX 3090 系统的替代方案。讨论表明,Qwen 3.6 在编码和代理任务方面表现出色,而 Gemma4 则更适合生成…
-
LLaMA 用户讨论 Qwen3.6 27B 与 35B-A3B 量化质量
r/LocalLLaMA 子版块的用户正在讨论他们对 Qwen3.6 模型不同量化版本的体验。具体来说,他们正在将 27B 参数模型的 IQ3 量化与 35B-A3B 变体的 Q4 量化进行比较。对话侧重于哪个版本在特定用例(尤其是在智能体应用中)提供了更好的能力,而不是原始生成速度。
-
用户寻求关于 RTX 5090 和 64GB RAM 的 LLM 性能优化建议
r/LocalLLaMA subreddit 上的一位用户正在寻求关于优化其硬件设置以运行大型语言模型的建议。他们拥有一块 NVIDIA RTX 5090 GPU 和 64GB DDR5 RAM,正在权衡是在 vLLM 中使用 Qwen 3.6 27b NVFP4,还是在 Llama 上使用 Q8 版本的 35b a3b 模型来执行代理编码任务。用户主要关心如何有效利用其系统的内存以获得更好的性能。