PulseAugur
实时 00:05:40
实体 Qwen3.5 35B A3B

Qwen3.5 35B A3B

PulseAugur coverage of Qwen3.5 35B A3B — every cluster mentioning Qwen3.5 35B A3B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 28
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 14
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-20 research_milestone The Qwen3.5 35B A3B model achieved a high score on the GPQA benchmark and demonstrated strong cost-efficiency. 来源
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 28 条
  1. TOOL · CL_210684 ·

    Qwen3.5 35B A3B 模型在 GPQA 上取得高分且成本效益显著

    Qwen3.5 35B A3B 模型展现了令人印象深刻的性能,在 GPQA 基准测试中取得了 81.9% 的分数。它还提供了高智能成本比,每美元提供 35.3 智能点。该模型的速度值得注意,处理速度为每秒 166.7 个 token,其整体性能超出了对其参数量的预期。

  2. TOOL · CL_210662 ·

    AI API 摘要:Qwen 价格飙升,Z.ai 增加 1M 上下文,AI21 & Mancer 模型下架

    2026 年 8 月 20 日的 AI API 摘要,重点介绍了各提供商的显著价格变动和模型更新。Qwen 的 Qwen3.6 27B 模型在提示词和完成词元的价格上都有大幅上涨,影响了长文本生成的成本。Z.ai 推出了其 GLM Latest 模型,具有 1M 词元上下文窗口,满足了需要广泛上下文的用户需求。AI21 的 Jamba Large 1.7 和 Mancer 的 Weaver (alpha) 模型已被移除,要求用户迁移其…

  3. RESEARCH · CL_198175 ·

    研究人员开发 Self-Harness,使 LLM 代理能够自主改进其自身系统

    一篇新研究论文介绍了一种名为“Self-Harness”的方法,该方法允许基于 LLM 的代理自主改进其自身的运行 Harness。这个迭代过程包括识别模型特定的失败模式、生成 Harness 修改以及通过回归测试验证这些更改。当应用于各种模型和基准测试时,Self-Harness 持续提高了性能,为实现自改进的 AI 代理指明了方向。

  4. TOOL · CL_190629 ·

    Flash-MoE 技术让大型 AI 模型能在 16GB 内存的 Mac 上运行

    一种名为 anemll-flash-llama.cpp 的新技术,能够让大型专家混合(MoE)模型在内存仅为 16GB 的 Mac 上运行。该方法将模型专家存储在 SSD 上,仅将必要的专家加载到小型缓存中,从而显著降低内存需求。基准测试表明,虽然这种方法受存储 I/O 限制,但它使得 Qwen3.5-35B-A3B 等模型能在消费级硬件上使用,其中 Q3_K_M 等量化方法被证明更实用。

  5. SIGNIFICANT · CL_184463 ·

    DeepGrove 发布适用于 iPhone 的 Maple-Preview AI,速度是 Bonsai 27B 的 13 倍

    AI 研究公司 DeepGrove 宣布推出 Maple-Preview,这是一款专为在 iPhone 等移动设备上高效运行而设计的新型 AI 模型。该模型在保持可比性能的同时,处理速度是另一款兼容 iPhone 的 AI Bonsai 27B 的 13 倍。与会降低 AI 模型精度的传统量化方法不同,Maple-Preview 从头开始采用三元处理(ternary processing)工程设计,以同时实现高性能和高效率。该模型是开…

  6. TOOL · CL_169767 ·

    研究发现:RAG 在教科书问答中优于 GraphRAG · arXiv 研究

    一篇新的 arXiv 论文比较了检索增强生成(RAG)和 GraphRAG 在数学教科书问答中的应用,使用了 477 个问答对的数据集。研究发现,基于嵌入的 RAG 模型,特别是 voyage-3-large,比 GraphRAG 取得了更高的检索准确率。GraphRAG 还检索了更多的上下文,影响了生成质量。研究表明,RAG 的优势在能力较弱的模型上更为明显,使其成为教育 AI 工具的经济高效选择。

  7. TOOL · CL_169015 ·

    SWE-rebench 新增多语言编码任务,GLM-5.2 领跑排行榜

    SWE-rebench 排行榜已更新,新增了一个多语言测试集,涵盖五种编程语言的软件工程任务:Go、Java、Python、Rust 和 TypeScript。此次更新包含了多个开源模型的性能指标,其中 GLM-5.2 的 Pass@1 分数最高,达到 62.9%。该项目计划在 3-4 周内进行另一次更新,重点关注适合本地部署的模型,并征集社区对未来评估的建议。

  8. TOOL · CL_168210 ·

    OpenAI 大幅削减 GPT-5.6 价格;Qwen 推出新模型

    OpenAI 已大幅降低其 GPT-5.6 系列的价格,其中 Terra 和 Terra Pro 模型的提示和完成成本分别削减了约 40-50%。该公司还移除了 GPT-5 Chat 和 GPT-4o Search Preview 模型,要求用户迁移。Qwen 等其他提供商推出了新模型 Qwen3.7 Flash,以具有竞争力的价格提供了 1M token 的上下文窗口,而 Z.ai 的 GLM 5.2 则出现了小幅降价。相反,NVI…

  9. TOOL · CL_160704 ·

    新研究表明MoE AI路由模仿霍夫曼编码

    一篇新的研究论文提出,AI模型中的混合专家(MoE)架构的功能类似于霍夫曼编码,一种数据压缩技术。该研究引入了频率-多样性定律,该定律表明像Phi-3.5-MoE和Gemma-4-27B-A4B这样的模型根据令牌的频率和复杂性来分配专家。然而,该论文发现Qwen3.5-35B-A3B由于负载均衡存在冗余问题,这掩盖了效率。为了解决这个问题,研究人员提出了子集差值剪枝,并提倡在未来的MoE设计中实现最小描述长度(MDL)最优性。

  10. SIGNIFICANT · CL_149991 ·

    上海人工智能实验室发布350亿参数Agents-A1模型,用于Agentic AI任务

    上海人工智能实验室发布了Agents-A1,这是一个基于Qwen3.5-35B-A3B构建的350亿参数混合专家模型。该模型根据Apache 2.0许可协议发布,专为复杂、多步骤的Agentic AI任务设计。开发者声称,在特定的Agent基准测试中,其性能可与万亿参数模型相媲美,重点在于扩展“任务视野”而非单纯的参数数量。发布内容包括评估代码,并支持商业用途,提供量化版本并兼容vLLM和SGLang进行推理。

  11. COMMENTARY · CL_145230 ·

    Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢

    一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。

  12. RESEARCH · CL_141148 ·

    UMoE管道增强领域特定MoE模型训练

    研究人员推出了一种新颖的管道UMoE,旨在优化混合专家(MoE)模型以适应领域特定任务。该方法包括修剪表现不佳的专家,将专家池重新增长到原始大小,然后应用监督微调。UMoE在各种领域和基准测试中都显示出持续的改进,包括数学准确性和编码任务的显著提升,而计算成本没有增加。

  13. TOOL · CL_139122 ·

    VIDRAFT 推出双 LLM 服务引擎,兼顾 GPU 吞吐量和 CPU 覆盖范围

    VIDRAFT 开发了两款不同的语言大模型服务引擎,分别针对不同的优化目标。VKAE 是一款内核级加速引擎,旨在最大化 GPU 上的吞吐量,在多请求场景下性能提升高达 23.4 倍,速度超过 10,000 tokens/秒。相比之下,VKUE 通过优化内存带宽而非原始计算能力,使得一个 34.7B 参数的模型能够在包括 CPU 在内的各种硬件上运行,适用于受监管或本地部署的工作负载。

  14. MEME · CL_137539 ·

    Reddit用户提出“本地LLM生存工具包”以实现离线AI

    Reddit论坛r/LocalLLaMA的一位用户提出了一个“本地LLM生存工具包”的概念。该工具包将是一个便携式USB驱动器,包含运行大型语言模型(LLM)离线运行所需的基本组件。提议的工具包包括适用于各种操作系统的CPU推理二进制文件、Qwen3.5 35B-A3B和Gemma 4 E4B等特定LLM模型、一个包含英文维基百科和免费授权书籍的压缩SQLite数据库,以及一个可以搜索该数据库的简单聊天界面。目标是在几乎任何PC或笔记…

  15. SIGNIFICANT · CL_131038 ·

    NVIDIA 发布 Audex,一个统一的音频-文本大语言模型,保留文本智能

    NVIDIA 推出了 Audex (Nemotron-Labs-Audex-30B-A3B),一个能够理解和生成音频及语音的统一音频-文本大语言模型。与许多文本性能有所下降的多模态模型不同,Audex 的设计旨在保持其 Nemotron-Cascade-2-30B-A3B 骨干模型的文本智能。该模型通过多阶段训练过程和纯文本强化学习来实现这一点,从而在文本基准测试中取得有竞争力的分数,并具备强大的音频能力,包括超越语音的通用音频生成。

  16. TOOL · CL_120180 ·

    llama.cpp 标志将 RTX 4070 上 Qwen 35B 模型速度提升 2.8 倍

    一份技术指南演示了如何在 RTX 4070 GPU(12GB VRAM)上运行 Qwen3.5-35B-A3B 模型时实现 2.8 倍的速度提升。实现这一性能提升的关键在于使用 `llama.cpp` 框架并设置特定标志:`-ngl 99` 将所有模型层卸载到 GPU,而 `--cpu-moe` 则将专家混合(MoE)层保留在 CPU 上。这种策略对于 MoE 模型尤其有效,因为每个 token 仅激活一小部分专家,当 VRAM 有限…

  17. RESEARCH · CL_128948 ·

    新研究聚焦大语言模型推理、长上下文和工具集成

    多篇研究论文探讨了大语言模型(LLM)推理能力的进步,重点在于提高长时任务和工具集成的性能。Apple的研究引入了LEAD,一种通过整合未来验证和重叠回滚来克服LLM推理中“无恢复瓶颈”的方法,使模型能够解决跳棋跳跃等复杂问题。其他论文提出了用于工具集成推理中的逐轮回溯自我蒸馏的TurnSight,衡量解释器稳定性的方法,以及通过测试时缩放和从失败轨迹中反思性学习来分析和改进推理过程的技术。此外,研究还探讨了优化推理接口以缩短响应时间…

  18. RESEARCH · CL_96671 ·

    新的调优方法提升了LLM编码代理的性能

    研究人员开发了一种名为探测与精炼调优的新方法,以提高大型语言模型(LLM)编码代理的性能。该技术侧重于增强指导代理访问代码存储库相关部分的引导文件。通过使用合成的bug修复探测,调优过程会迭代地诊断和精炼这些引导文件,从而显著提高代理解决编码任务的能力。这种改进源于对相关文件更好的覆盖率,而不是代码更改本身的精度提高。

  19. RESEARCH · CL_88570 ·

    oMLX 在 Mac LLM 推理速度上显著优于 Ollama

    对在 Mac 设备上本地运行 LLM 的 oMLX 和 Ollama 进行的性能比较显示出显著的速度差异。oMLX 利用 Apple Silicon 的 MLX 框架,与使用 GGUF 后端的 Ollama 相比,其 token 生成速度快了 35%,多轮对话延迟降低了 7 倍。虽然 oMLX 提供了 SSD KV Cache 和 Continuous Batching 等专业功能,但 Ollama 在跨平台兼容性和更广泛的模型生态系…

  20. RESEARCH · CL_88575 ·

    oMLX 通过 KV 缓存提升 Apple Silicon LLM 性能

    oMLX 是一个面向 Apple Silicon 的开源 LLM 推理服务器,在处理大型模型和复杂工作流方面展现出显著的性能提升。社区基准测试和本地测试突显了 oMLX 相较于 Ollama 和 LM Studio 等替代方案的优势,尤其是在涉及编码代理和持久化 KV 缓存的场景中。该服务器利用 SSD 进行 KV 缓存的能力极大地缩短了首次令牌生成时间 (TTFT),使得 Claude Code 和 Qwen3-Coder-Next…