Qwen 3.5 35B A3B
PulseAugur coverage of Qwen 3.5 35B A3B — every cluster mentioning Qwen 3.5 35B A3B across labs, papers, and developer communities, ranked by signal.
-
用户通过KVarN量化在17GB模型上实现100万上下文窗口
Reddit的r/LocalLLaMA论坛上一位用户报告称,他成功加载了一个拥有100万token上下文窗口的大型语言模型,在24GB显存的显卡上使用了约17GB显存。这是通过一个基于Qwen的350亿参数模型实现的,使用了KVarN 4位量化方法来处理KV缓存。该用户能够从文本的各个部分提取信息,表明上下文窗口是功能性的,并且没有损坏。
-
AI代理Kernel Forge为PyTorch模型自动优化CUDA内核
研究人员开发了Kernel Forge,一个开源的代理式框架,它使用大型语言模型自动生成和优化PyTorch模型的CUDA内核。该工具旨在减少对专家工程师手动编写底层GPU代码的需求。Kernel Forge支持各种工作负载,包括视觉、扩散和LLM模型,并采用蒙特卡洛树搜索进行优化。它已显示出显著的速度提升,在多个内核上优于PyTorch的eager模式,并在ResNet-50和Gemma 4-E2B等模型上取得了显著改进。
-
Ornith 35B 在创意任务中展现出强劲性能
Ornith 35B 语言模型已显示出有希望的结果,尤其是在生成 3D 游戏等创意任务方面。用户报告称,Ornith 35B 在三次提示内成功完成了此任务,表现优于 Qwen 3.5-35B-A3B 等在类似请求中遇到困难的其他模型。该模型与 Claude Code harness 一起使用。
-
新的大型语言模型因过大或过于复杂而无法在家庭实验室运行
作者详细说明了最近发布的三个大型语言模型——DeepSeek V4-Pro、DeepSeek V4-Flash 和 Zyphra ZAYA1-8B——目前为何无法在典型的家庭实验室硬件上运行。DeepSeek V4-Pro 体积过大,为 805 GB,需要数据中心规模。DeepSeek V4-Flash 虽然体积较小,但仍需要大量内存,并且缺乏广泛的软件支持。Zyphra ZAYA1-8B 体积合适,但使用了新颖的架构,尚未开发出相应的推理软件。
-
Claude Opus 和 Qwen 3.5 展示了不同的创意优势
对 Anthropic 的 Claude Opus 4.6 和 Qwen 3.5 35B-A3B 这两个大型语言模型的比较,揭示了它们在创意任务上截然不同的方法。当收到相同的提示,要求从五个“素材文件”中识别并起草博客文章时,Opus 选择撰写一篇关于具有挑战性的 API 调试经历的文章,侧重于叙事和技术问题解决。相比之下,Qwen 则优先撰写一篇关于改进博客标签系统的、数据驱动的文章,展示了在起草前更系统化的规划过程。