Qwen3.5-122B
PulseAugur coverage of Qwen3.5-122B — every cluster mentioning Qwen3.5-122B across labs, papers, and developer communities, ranked by signal.
- 2026-07-16 product_launch A new version of the Qwen3.5 model, the 122B-A10B variant, has been released with optimizations for AMD's ROCm platform and iMatrix quantization. 来源
1 天有情绪数据
-
Qwen3.5 122B A10B 模型展现出强劲的性能和效率
Qwen3.5 122B A10B 模型,特别是其非推理能力,已达到每秒 147.6 个 token 的性能基准。此外,它还展示了每美元 16.1 个智能点的效率。这些指标均经过独立验证,区别于供应商提供的声明。
-
新款本地大模型AI-PC性能不及GPU
一款专为本地大模型运行设计的新款AI-PC已发布,但其性能相比基于GPU的系统被认为较慢。该设备支持Qwen3.5-122B和DeepSeek V4 Flash等大型模型,Qwen3.5-122B的速度最高可达27.16 tokens/秒,DeepSeek V4 Flash约为12 tokens/秒。尽管内存速度和容量有所提升,但AI-PC的带宽远低于高端GPU,因此得出结论,对于普通用户来说,云端解决方案可能更实用。
-
新研究评估大型语言模型通过对话修订工件的能力
一篇新研究论文探讨了大型语言模型(LLM)如何根据对话反馈有效修订生成的工件。该研究引入了一个基准来评估LLM在用户仅指定局部更改时,识别和传播修订跨工件的能力。使用GPT OSS 20B和Qwen3.5-122B等模型进行的实验表明,通过LLM或medoid选择从并行样本中进行选择,是提高修订准确性最具成本效益的方法。
-
新基准 RevPropBench 测试 LLM 在对话中的修订传播
研究人员推出了 RevPropBench,这是一个旨在评估大型语言模型 (LLM) 在通过对话交互生成工件时的修订传播能力的新基准。该研究探索了测试时计算的经济高效方法,在 GPT OSS 20B、GPT-OSS 120B、GPT 5.4 Mini 以及各种 Qwen3.5 模型上测试了九种不同的修订技术。结果表明,基线方法的准确率在 68.3% 到 93% 之间,从三个选项中并行采样被证明是最具成本效益的方法,准确率提高了 9.7%。
-
新搜索方法提高了 AI 研究代理的决策能力
研究人员开发了 HypoSearch,一种通过指导其搜索策略来增强深度研究代理的新方法。这些代理在早期决策时常常遇到困难,在收集到足够证据之前就承诺于单一研究路径,如果初始方向有误,可能导致失败。HypoSearch 通过生成假设作为搜索提示,在并行分支中探索它们,并在最终承诺之前比较证据来解决这个问题。该方法在多个基准和骨干模型上都显示出显著的改进,包括在 BC-small 基准上提升了 Qwen3.5-122B 的性能。
-
开发者在 AMD MI300X GPU 上本地运行 122B Qwen LLM
一位开发者已成功在 AMD MI300X GPU 基础设施上本地部署了 Qwen3.5-122B 大语言模型。该设置利用 vLLM 和 SGLang 进行推理,并使用 OpenClaw 构建了一个自主 Agent。此次部署突显了自托管前沿规模模型的可行性,在一个 192GB 的 MI300X GPU 上即可实现数据主权、成本可预测性以及不受 API 速率限制等优势。
-
Mac Studio 通过优化的冷缓存高效服务 Qwen3.5-122B
一位开发者优化了 qMLX 引擎,以便在内存为 96GB 的单台 Mac Studio 上高效地为 Qwen3.5-122B 模型的多个会话提供服务。通过实施一种严重依赖磁盘 KV 缓存的冷缓存策略,系统显著减少了预填充计算量,从而能够以最小的 GPU 负载运行并发会话。此优化使得本地模型可用于子代理功能。
-
Qwen3.5 122B 模型针对 AMD ROCm 进行了优化,支持 iMatrix
Qwen 模型的新版本已发布,特别是 122B-A10B 变体。此版本针对 AMD 的 ROCm 平台进行了优化,并采用了 iMatrix 量化方法,解码速度达到 28.50 token/s。与先前版本相比,该模型体积减小了 13.47 GB,解码速度提高了 36.89%,拥有 100 亿个活跃参数。
-
Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢
一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。
-
Qwen3.5-122B 模型在 Mac Studio 用户上的稳定性得到改善
一位开发者解决了三个关键错误,这些错误曾阻碍 Qwen3.5-122B 模型在 Mac Studio 硬件上可靠地用于日常使用。这些修复确保了该模型现在能在指定的 Apple 电脑上更一致地运行。
-
用户在添加第二个 RTX 3060 GPU 后遇到 LLM 加载问题
一位 r/LocalLLaMA 子版块的用户在添加第二个 RTX 3060 显卡后,在加载大型语言模型时遇到问题。此前,使用单个 3060 时,用户可以加载 Qwen3.6 27B、Qwen3.6 35B 和 Qwen3.5 122B 等模型并进行 CPU 卸载。然而,在安装第二个显卡后,只有密集模型能按预期加载,而 35B 模型仅加载了一次,122B 模型现在完全无法加载。用户正在寻求有关配置更改或故障排除步骤的建议,以解决此加载问题。
-
LLM 用户寻求关于升级到 40B+ 参数模型以提高速度和知识的建议
r/LocalLLaMA subreddit 上的一位用户正在寻求关于拥有超过 400 亿参数的大型语言模型 (LLM) 的推荐。他们目前使用的是 Qwen3.6 35B,但发现它缺乏通用知识,更像一个执行者而不是助手。用户正在考虑升级到 Qwen3.5 122B,但担心速度问题,因为他们在 Strix Halo 硬件上使用 131k 上下文窗口时,目前能达到大约 30-40 tokens/秒。
-
用户寻求在消费级硬件上提升 Qwen3.5-122B 的性能
一位用户正在寻求优化 Qwen3.5-122B 大型语言模型在其硬件上的性能,该硬件包括 32GB VRAM 和 64GB RAM。他们目前遇到的 token 生成速度在每秒 6 到 20 个 token 之间,并正在寻找提高吞吐量的方法。用户已分享了他们的具体命令行参数和输出日志,以帮助诊断问题并找到潜在的解决方案。
-
AI 代理推荐用于 Python Web 开发
一位 r/LocalLLaMA 子版块的用户正在寻求 AI 代理设置的推荐,以协助在 PyCharm 中进行 Python Web 开发。他们拥有强大的硬件设置,配备 128GB RAM,能够运行 GPT-OSS 120b 和 Qwen3.5-122b 等大型模型,但发现由于需要进行广泛的错误测试,这个过程很繁琐。用户正在寻找一种更结构化的方法,可能涉及一个规划模型、一个执行模型和一个单独的测试模型,以简化开发过程。
-
AI社区质疑为何缺乏新的100B-120B参数语言模型
r/LocalLLaMA subreddit上的一项讨论突显了社区对100B-120B参数范围内新大型语言模型缺乏的看法。虽然之前存在GPT-OSS-120B、GLM-4.5-Air、Nemotron-3-Super、Qwen3.5-122B和Mistral-Small-4-119B等模型,但社区注意到这些模型现在已经发布数月。当前发布的新模型要么更小(25B-35B),要么更大(200B+),这引发了关于约120B MoE家族是否已…
-
新基准显示LLM在波兰医学考试中表现不佳
基于波兰医学考试开发了一个新的基准,以更好地评估大型语言模型(LLM)在医学领域的真实能力。该基准包含超过15,000个问题,并进行了结构性修改以减少偏见,结果表明标准的单项选择题回答格式可能会高估LLM的能力。即使是表现最好的模型,如Qwen3.5-122B,在这种更严格的评估中也显示出显著的性能下降。
-
用户报告在使用 llama.cpp 的 Qwen 3.x 模型时草稿接受率低
一位 Reddit r/LocalLLaMA 子版块的用户在使用 llama.cpp 运行 Qwen3.5-122B 和 Qwen3.6-27B 模型时,遇到了草稿接受率低的问题。用户报告称,在涉及代码片段的聊天中,接受率在 40-60% 之间,低于其他用户看到的约 80% 的接受率。他们正在寻求关于 llama-server 命令中潜在的错误配置的建议,该命令包含草稿接受和上下文拟合的特定参数。
-
雷神与AMD推出面向大模型的AI工作站
雷神与AMD合作推出全面的AI工作站产品线,涵盖塔式、迷你PC和移动形态。这些新机器旨在满足日益增长的AI计算能力需求,特别是运行大型语言模型和基于代理的应用程序。产品系列包括配备AMD Threadripper PRO 9995WX和多个AI Pro R9700加速器的AI Master T9000等高端型号,能够微调130B模型,以及满足各种用户需求的更易于获得的选项。
-
辩论协议在特定场景下提高了AI法官的准确性
研究人员探讨了使用辩论协议来提高AI法官在评估更强大模型响应时的准确性的有效性。他们发现,当批评者模型在分类答案方面优于法官模型,并且法官模型将批评者的输入视为验证提示而非权威证词时,辩论有所帮助。这种方法在奖励标签方面显示出改进,特别是在防止接受错误答案方面,这对于对齐AI行为至关重要。
-
LLM Harness 复杂性悖论:可靠性不总是与能力挂钩
一项新的研究论文挑战了普遍认为更复杂的 Harness 总是能提高 LLM 代理可靠性的假设。在六种模型和四个能力层级进行的实验显示,增加 Harness 的冗余度会降低某些模型的可靠性,而更严格的 Harness 则可以提高可靠性并降低延迟。研究还发现,一个较小的模型在各种 Harness 条件下实现了与更高级别模型相当的稳定性,这表明 Harness 敏感度呈非单调性,并且取决于模型类型。