PulseAugur
中
实时 21:02:43
实体 Qwen3.6 35B-A3B

Qwen3.6 35B-A3B

PulseAugur coverage of Qwen3.6 35B-A3B — every cluster mentioning Qwen3.6 35B-A3B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
94
90 天内 94
发布 · 30天
0
90 天内 0
论文 · 30天
22
90 天内 22
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-25 product_launch Alibaba's Qwen team released the Qwen3.6-35B-A3B model, a sparse MoE model designed for efficient local deployment. 来源
  2. 2026-05-19 product_launch A method to run a 35B multimodal LLM on free Kaggle GPUs via an OpenAI-compatible API has been developed. 来源
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/6 页 · 共 103 条
  1. COMMENTARY · CL_280760 ·

    AI 编码器的教训:8 位量化在代理任务上优于 4 位量化

    一位 Mastodon 用户分享了他们使用 AI 模型进行代理编码的经验,建议不要使用 Q4 模型。他们发现 Qwen3.6-35B-A3B 和 Ornithogalum-1.5-35B-A3B 表现良好,尤其是在使用 8 位量化变体时,这与 4 位量化相比有显著差异。

  2. TOOL · CL_279332 ·

    新的推理引擎提升了 Qwen 3.6-35B-A3B 在 16GB GPU 上的性能

    一个名为 AgrillaMoE 的新推理引擎已被开发出来,它从 llama.cpp 分叉而来,用于优化 Qwen 3.6-35B-A3B 模型在 16GB GPU 上的使用。该引擎利用 Unsloth quants 和一种新颖的“MoE 扩展”技术,允许在不重新训练的情况下,每 token 咨询更多的模型专家。据报道,这种方法在 GPQA-Diamond 等基准测试中提高了性能,得分高于标准配置。

  3. TOOL · CL_273418 ·

    新型 QuantCode 模型专门化 LLM 以用于算法交易代码

    研究人员开发了 QuantCode 模型,这是一个专门用于生成可执行算法交易代码的大型语言模型。该模型利用了交易框架代码的持续预训练以及经过验证的请求-代码对的监督微调(SFT)。在 QuantCode-Bench 基准测试上的评估表明,代码生成准确性和回测成功率有了显著提高,其中 SFT 在增强代理评估性能方面尤其有效。

  4. RESEARCH · CL_271199 ·

    新研究探索具有刚体力学和权重分析的 Transformer 架构 · 跟踪 5 个来源

    研究人员正在探索通过整合刚体力学和分析权重结构来增强 Transformer 架构的新方法。一篇论文介绍了“Screw Attention”,这是一种 Transformer 层,它使用刚体代数对物体之间的空间关系进行建模,在操作任务和几何变化鲁棒性方面表现出改进的性能。另一项研究“JET: Justification Evaluation in Transformer”专注于提高 Transformer 在 MMLU 等任务中的决策…

  5. TOOL · CL_282517 ·

    QuantCode 模型专注于为算法交易代码生成进行专业化LLM

    研究人员开发了QuantCode模型,这是一个专门用于生成可执行算法交易代码的语言模型。通过在交易框架代码上进行持续预训练,并结合经过验证的请求-代码对的监督微调,该模型在QuantCode-Bench基准测试上的性能得到了显著提升。这种方法增强了单轮代码生成和多轮代理成功率,尽管领域专业化被发现会降低结构化工具调用能力,这需要有针对性的SFT来部分恢复。

  6. SIGNIFICANT · CL_269093 ·

    H Company 发布 Holo4 AI 代理模型,支持跨平台使用

    H Company 推出了 Holo4,这是一个专为 AI 代理设计的新型开源模型系列,能够与桌面、网页界面和 API 进行交互。该模型有两种尺寸:Holo4 27B 和 Holo4 35B-A3B,提供 256K 上下文窗口,旨在弥合仅限 GUI 的代理与依赖特定 API 的代理之间的差距。虽然 Holo4 35B-A3B 可根据 Apache 2.0 许可证用于商业用途,但 Holo4 27B 的权重仅限于非商业应用。

  7. TOOL · CL_268887 ·

    RAZOR方法在不牺牲推理能力的情况下精简大型语言模型专家

    研究人员开发了RAZOR,一种在不显著降低推理能力的情况下精简混合专家(MoE)模型中专家的新方法。与以往关注专家频率或孤立贡献的方法不同,RAZOR通过衡量专家删除造成的损害来评估功能可替换性。这种无需训练的方法使用共识残差来计算删除专家所产生的确切输出变化,仅通过前向传播即可实现精简。RAZOR在多个大型语言模型和专家移除预算上均表现出卓越的性能,在以推理为中心的任务上优于现有方法。

  8. TOOL · CL_285180 ·

    SlimWise 框架提升 MoE 模型服务效率

    研究人员开发了 SlimWise,一个旨在提高专家混合(MoE)模型服务效率的新框架。SlimWise 将专家剪枝解耦,仅在解码阶段应用,而在预填充阶段使用完整模型。这种方法允许在解码过程中重用预填充生成的 KV 缓存,显著减少流量瓶颈。该框架还包括一个低成本的蒸馏阶段,以进一步弥合准确性差距。在 vLLM 中实现后,SlimWise 在 Qwen3.6-35B-A3B 模型上实现了高达 1.81 倍的解码吞吐量提升,同时仅进行了 5…

  9. RESEARCH · CL_267050 ·

    新研究探讨 LLM Agent 的审计、安全和决策 · 已追踪 10 个来源

    多篇研究论文正在探索用于评估和改进大型语言模型 (LLM) Agent 性能和安全性的新颖方法。这些研究引入了用于审计通信的框架、分析表示转换以检测安全风险以及开发用于 Agent 恢复的因果评估方法。此外,研究还侧重于空间策略、科学计算的可执行检查以及认知行动的概念,以增强基于 LLM 的系统的决策能力。研究结果强调了理解 Agent 内部状态、通信内容和决策过程对于降低风险和提高可靠性的重要性。

  10. TOOL · CL_261306 ·

    Anthropic推出Claude Code Projects;Google更新Gemini智能体

    Anthropic为其Claude Code推出了“Projects”功能,使用户能够在单次对话中管理多个并行云会话,支持上下文传递并在用户离开后继续执行。Google更新了其Gemini托管智能体,引入了新的工具包以及用于凭证管理和工件移动的API,旨在降低成本并提高缓存命中率。讨论还涉及Jev,一个快速、受限输出的模型,被视为大型AI系统中的路由或决策层,尽管有人反对将其用于激进的内存压缩。

  11. MEME · CL_242673 ·

    Qwen3.6 35B A3B 与 Nex-N2.5-mini 在编码任务上的对比引发讨论

    一位 Reddit r/LocalLLaMA 版块的用户正在就两款语言模型 Qwen3.6 35B A3B 和 Nex-N2.5-mini 在编码任务上的选择寻求建议。该用户目前使用 MTP 运行 Qwen3.6 35B A3B,但希望性能有所提升。

  12. TOOL · CL_242330 ·

    FreeToken 引擎可在个人 PC 上运行大型 MoE 模型

    FreeToken 是一个开源引擎,旨在通过将整个 PC 作为异构推理系统来在个人硬件上运行大型混合专家(MoE)模型。它通过将完整的专家池存储在 CPU 主机 RAM 中,同时将非专家权重和共享专家缓存保留在 GPU 中来管理 MoE 模型。该系统动态测量主机内存和 PCIe 带宽,以优化 CPU 和 GPU 之间的专家执行,并采用双缓冲来隐藏预填充期间的传输延迟。此外,FreeToken 还为代理工作负载提供语义感知缓存,允许它在…

  13. TOOL · CL_239259 ·

    ACE框架通过跳过冗余专家计算来优化MoE大型语言模型

    研究人员开发了ACE,一个新颖的框架,旨在通过自适应地跳过冗余专家计算来优化混合专家(MoE)大型语言模型。这种无需训练的方法利用全局谱代理和路由器条件细化来估计专家贡献,而不依赖于路由器置信度或校准数据。ACE在各种基准测试和MoE模型上始终优于现有方法,显著降低了困惑度并提高了下游准确性,尤其是在激进的专家跳过场景下。

  14. TOOL · CL_254020 ·

    Occamy-1.0:新的 35B 协同工作智能体优先考虑成本效益

    研究人员推出了 Occamy-1.0,这是一款新推出的 350 亿参数协同工作智能体模型,旨在提高复杂、多步任务的效率。通过使用执行为基础的数据对 Qwen3.6-35B-A3B 检查点进行进一步训练,Occamy-1.0 旨在平衡强大的性能和较低的成本,这对于每次任务可能调用模型数百次的智能体至关重要。该模型在各种基准测试中展示了与更大系统相比的竞争力,在保留工具使用和编码等广泛的智能体能力的同时,将其定位在成本-性能帕累托前沿。

  15. TOOL · CL_234045 ·

    Perplexity 将 Lily AI 引擎开源以支持 Apple Silicon

    Perplexity 正在开源其 Lily AI 引擎,该引擎专为在 Apple Silicon 上进行本地人工智能处理而设计。该引擎使用 Rust 构建,并支持 Qwen3.6-35B-A3B 模型,旨在直接在用户设备上提供更快速的 AI 功能。

  16. TOOL · CL_233724 ·

    Perplexity 开源适用于 Apple Silicon 的 Lily 推理引擎

    Perplexity 已开源 Lily,一个使用 Rust 和 Metal 构建的专用推理引擎,用于在 Apple Silicon 上运行 Qwen3.6-35B-A3B 模型。该引擎专为狭窄的硬件优化而设计,与 MLX-LM 等通用框架相比,解码速度提高了 1.35 倍,预填充速度提高了 1.23 倍。Lily 的架构绕过了 PyTorch 和 MLX 等传统框架,利用手工编写的 Metal 内核进行执行,并提供了一个与 OpenA…

  17. RESEARCH · CL_235142 ·

    新的环境演化方法提升终端代理性能 · 追踪 4 个来源

    研究人员开发了一种名为“环境演化”的新方法来改进终端代理的训练。该技术在策略外(off-policy)逐步增加训练环境的难度,随着模型的进步提供持续的学习信号。使用该方法进行的实验在 Terminal-Bench 2.1 基准测试中显示出显著的性能提升,Qwen3.6-27B 和 Qwen3.6-35B-A3B 模型分别提高了 14.4 和 18.0 个百分点。该方法已与 Hy4 preview、Claude Opus 5 和 GPT…

  18. TOOL · CL_232829 ·

    Perplexity 开源 Lily 推理引擎以支持 Apple Silicon

    Perplexity 已开源 Lily,这是一个专为 Perplexity Computer 产品中的混合计算设计的本地推理引擎。Lily 专门针对在 Apple silicon 上运行 Qwen3.6-35B-A3B 模型进行了优化,将其视为一个独立的平台。基准测试显示,在 M5 Max MacBook Pro 上,Lily 在 prefill 和 decode 吞吐量方面均优于 MLX-LM,在保持输出质量的同时,有效地处理了 p…

  19. TOOL · CL_232108 ·

    双模型文学翻译流水线在 Tesla P40 上实现每天 2-3 本书的翻译量

    一位用户详细介绍了一个利用两块 Tesla P40 GPU 进行文学书籍翻译的双模型流水线。该流水线使用 Gemma 4 - 26B-A4B 进行翻译,速度约为每秒 40 token,并使用 Qwen3.6 35B-A3B 进行校对,速度为每秒 50-70 token。该设置利用了多 token 预测 (MTP) 推测解码和 64K 上下文窗口,以实现高效、大批量的整本书翻译。

  20. TOOL · CL_224948 ·

    新的大语言模型基准测试显示 Qwen3.8 Flash Next 在 DGX Sparks 上领先

    一位 r/LocalLLaMA 上的用户分享了包括 DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B 和 Qwen3.6-35B-A3B 在内的几款新大语言模型的性能基准测试。测试在 NVIDIA DGX Spark 硬件上进行,重点关注运行时间、服务上下文长度和每秒交付的 token 数等指标。Qwen3.8 Flash Next 模型,尤其是在“中等”设置下,取得了最高的 22/24…