Qwen 3.6:35B
PulseAugur coverage of Qwen 3.6:35B — every cluster mentioning Qwen 3.6:35B across labs, papers, and developer communities, ranked by signal.
- 2026-05-24 product_launch Release of the uncensored Genesis APEX MTP version of the Qwen 3.6-35B model. 来源
8 天有情绪数据
-
英伟达的 NeMo Switchyard 将 AI 代理成本降低 74%,盖过了其新模型发布
英伟达发布了两项新技术:Nemotron 3.5 Lightning,一个开源权重语言模型;以及 NeMo Switchyard,一个用于 AI 代理的开源路由库。虽然 Nemotron 3.5 Lightning 是一个标准的 30B 参数模型,但 NeMo Switchyard 因其显著降低 AI 代理成本的潜力而备受关注。早期基准测试表明,NeMo Switchyard 可通过智能路由请求至更便宜的模型,将大部分调用避开昂贵的尖…
-
Qwen 3.6 35B模型在Radeon 7600 GPU上以21 token/秒的速度运行
Reddit用户在r/LocalLLaMA子版块分享了他们使用GGUF格式的Qwen 3.6 35B模型在Radeon 7600显卡上运行的经验。在超频VRAM并使用llama.cpp优化设置后,他们达到了每秒21个token的速度。用户还注意到一个奇怪的bug,即当应用程序窗口可见时,token生成速度会降低,而最小化时则会提高。
-
Inkling-Small 276B-A12B 模型针对低内存消费级硬件进行了优化
Inkling-Small 276B-A12B 模型(约有 120 亿活跃参数)的新转换版本已针对在内存小于 10GB 的消费级硬件上运行进行了优化。基准测试显示,该模型在生成时速度约为每秒 2.9 个 token,但长提示预填充时间被指出是一个问题。这一发展是使大型混合专家(MoE)模型在标准硬件上可访问的持续努力的一部分。
-
Mach-1 Additive 模型以 10 倍小的体积实现了与 Qwen 3.6 35B 相媲美的性能
一款名为 Mach-1 Additive 的新模型据称在体积小 10 倍的情况下,达到了 Qwen 3.6 35B 性能的 95%。这一进展在本地 LLM 社区引发了讨论,用户们质疑为何如此重要的模型没有获得更多关注。该模型的效率预示着在资源受限的 AI 应用方面取得了显著进展。
-
KAT Coder 2.5 因速度和准确性优于 Qwen、Gemma 而获赞
一位开发者推荐 KAT Coder 2.5 模型,强调其在速度和准确性方面优于 Qwen 3.6 35b 和 Gemma 4 等模型。该开发者分享了一个 GitHub 仓库,详细介绍了他们的测试方法和性能比较,供他人审阅。他们鼓励用户亲自尝试该模型,因为个人用例比基准测试能提供更具信息量的结果。
-
TurboFieldfare引擎适配Qwen 3.6 35B,降低RAM使用量
一位用户已成功将最初为Gemma模型设计的TurboFieldfare引擎适配到支持Qwen 3.6 35B。由于其更小的专家模型和线性注意力机制的使用,此次移植使得Qwen模型所需的RAM更少,约为1.4 GB,而Gemma需要2.1 GB。虽然在用户的M5机器上,Qwen模型的每秒令牌数速度较慢,但这归因于其更大的专家模型文件需要更频繁的SSD读取。
-
新的AfriEconQA基准挑战AI在经济报告推理方面的能力
研究人员推出了AfriEconQA,这是一个新的基准,旨在测试AI模型在处理冗长的机构文件时的定量和时间推理能力。该基准源自220份关于非洲经济的世界银行经济报告,包含4,309个问答实例,侧重于精确的数值和时间数据提取。使用检索增强生成技术对Qwen 3.6 35B、DeepSeek V4-Pro和Gemma 4 12B IT等模型进行的评估显示出显著的进步,但仍难以达到高准确率,这表明AI在处理复杂的经济报告方面仍面临一个具有挑战…
-
Nifer 推理引擎在 Qwen 3.6 35B 模型上实现 720t/s
一款名为 Nifer 的新推理引擎已发布,据报道在 Qwen 3.6 35B 模型上实现了 550-720 tokens/秒的速度。用户形容这种性能“简直是疯了”,它无需复杂的批处理或并行代理即可实现,并支持 250k tokens 的上下文窗口。该引擎专门针对 RTX 5090 GPU 进行了优化,可在 GitHub 上获取,最初支持 Linux,未来可能支持 Windows。
-
Kimi Linear 48B A3B 模型提供 100 万上下文和快速性能
一款名为 Kimi Linear 48B A3B 的新型大型语言模型已经出现,它拥有 100 万个 token 的上下文窗口,并采用具有 480 亿参数的混合专家(Mixture-of-Experts)架构。用户报告称其运行速度很快,在速度上优于 Qwen 3.6 35B 等模型。虽然能够生成结构化内容,包括动画页面,但一些用户指出其响应可能比较简略,并建议可能需要进行微调以提高其推理或输出质量。
-
MadMax Ltx2.3 模型详解及提示词示例
一位Reddit用户分享了关于MadMax Ltx2.3模型的细节,该模型是文本到视频模型的一个量化版本,并指出其与Qwen 3.6 35b提示词生成器一起使用。该帖子包含旨在生成具有《疯狂的麦克斯》美学的电影场景的详细提示词示例,重点关注激烈的车辆追逐和凶猛的女性角色。这些提示词强调超细节反射、如灰尘和泥土等逼真的环境效果,以及动态的摄像机运动,以创造一种粗犷、生动的体验。
-
Hermes LLM 通过 Graphene OS 和远程网关在 Android 上运行
一位用户已成功将 Hermes 大型语言模型集成到 Android 系统中,特别是在 Graphene OS 上,并利用了远程网关设置。该系统以 Llama.cpp 和 Qwen 3.6 35b 作为后端,在提示处理和生成速度方面报告了令人印象深刻的性能指标。此设置可在移动设备上实现完全本地化且高效的 AI 体验,展示了智能手机上高级 AI 应用的潜力。
-
Strix Halo 因在本地部署 LLM 时的能效和价值而受到赞誉
一位 Reddit 用户分享了他们使用 Strix Halo 的经验,强调了其在运行本地大型语言模型方面的能效和价值。他们报告称,即使在高负载下,该设备每天的消耗也最多为 0.48 美元,他们认为这比 A6000 等传统 GPU 具有显著优势。用户还注意到 Strix Halo 的多功能性,为推理以外的托管服务提供了充足的资源。
-
本地AI助手Bella在ESP32板上运行,使用Qwen 3.6模型
一位用户已成功将名为Belochka或Bella的本地AI助手集成到他们的日常生活中,该助手运行在Mac上,可通过ESP32 w-10板访问。该设置利用了Qwen 3.6 35B模型,并允许Bella充当个人助理,管理任务、访问文件,甚至生成音乐等内容。用户强调了本地AI应用程序的可访问性和潜力,特别是与ESP32生态系统相结合,可用于从家庭安全到个人组织等各种用例。
-
LLM社区呼吁紧急发布80-160B参数模型
r/LocalLLaMA子版块的用户正在表达对80-1600亿参数范围内新的大型语言模型(LLM)的强烈需求。现有模型要么对于拥有高容量但速度较慢的统一内存系统(如Apple设备或AMD Ryzen AI 395)的用户来说太小,要么对于VRAM有限的用户来说太大。社区要求能够有效利用80-128GB RAM或64GB VRAM的系统运行的模型,因为现有选项要么过时,要么不适合他们的硬件配置。
-
AI系统ACIE在临床数据提取中达到96.5%的准确率
一种名为ACIE的新型Agentic检索增强生成(RAG)系统已在埃森大学医学中心开发并部署,用于临床信息提取。该系统通过处理复杂的患者数据、时间推理和跨文档依赖性,解决了标准RAG的局限性。在一项回顾性淋巴瘤登记研究中,ACIE在超过7000项判断中获得了核医学医生96.5%的接受率,证明了其在准确提取和验证临床信息方面的有效性。
-
Qwen 3.6 35B 模型可在消费级硬件上运行,支持 32k 上下文
一位 Reddit 用户分享了他在消费级硬件上运行 Qwen 3.6 35B 模型的经验,该配置包括一块 RTX 3080 GPU 和 32GB RAM。在 32k 的上下文长度下,他实现了 26 tokens/秒的生成吞吐量和 1400 tokens/秒的处理吞吐量。虽然将 KV 缓存卸载到 GPU 可以将生成速度提高到 56 tokens/秒,但这会限制上下文窗口,不适合他涉及深度研究和文档处理的代理工作。
-
Cohere发布North-Mini-Code-1.0编码模型
Cohere发布了North-Mini-Code-1.0,一个拥有300亿参数的编码模型。虽然其通用人工智能分析得分低于某些竞争对手,但在编码基准测试中表现具有竞争力。该模型可在Hugging Face上供用户下载和使用。
-
Qwen 3.6 35B 模型在代理任务中凭借 KV Cache 表现出色
r/LocalLLaMA 上的一位用户发现,在使用 KV Cache 时,Qwen 3.6 35B 模型在代理任务上的表现明显优于 27B 版本。该用户最初因为感知到的智能和速度而偏爱 27B 模型,但遇到了上下文溢出问题。切换到使用未量化的 KV Cache 的 35B 模型解决了这些问题,从而实现了更快、更有效的任务完成。用户还注意到,为了更好地管理上下文,已从 LM Studio 转向 llama.cpp。
-
DDR5 带宽成为 AMD APU 双 LLM 推理的瓶颈
一位开发者的实验表明,AMD APU 上的 DDR5 带宽严重限制了同时运行多个大型语言模型(LLM)的性能。尽管像 Qwen 3.6:35B 这样拥有 350 亿参数的模型,在每个 token 上似乎只使用了其参数的一小部分,但其实际推理速度受到共享内存带宽的限制,使其性能与较小模型相当。这一发现导致在尝试在同一硬件上并发运行两个模型时,由于性能下降而放弃了多模型代理架构。
-
Qwen 3.6-35B 模型发布了无审查的 Genesis APEX MTP 版本
Qwen 3.6-35B 模型的新无审查版本 Genesis APEX MTP 已发布。该模型性能令人印象深刻,能够处理高达 200k 的上下文而不会出现故障,并成功管理复杂的交叉任务。它为 Apple MLX 转换提供 safetensors 支持,并推荐 APEX 和 MTP-APEX 等特定量化方法以获得最佳使用效果。