实体
QWEN3.6-35B-A3B NVFP4
QWEN3.6-35B-A3B NVFP4
PulseAugur coverage of QWEN3.6-35B-A3B NVFP4 — every cluster mentioning QWEN3.6-35B-A3B NVFP4 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Freetokens 项目旨在通过新版本提高 LLM 效率
一个名为 Freetokens 的新项目已发布,旨在提高大型语言模型的效率。在配备 16GB VRAM 的 RTX 5080 上进行的早期测试,使用 QWEN3.6-35B-A3B NVFP4 模型,实现了大约每秒 100 个 token。该项目包括一篇研究论文和一个用于实现的 GitHub 存储库。
-
NVIDIA 量化 Alibaba 的 Qwen3.6-35B 模型以实现高效部署
NVIDIA 发布了 Alibaba 的 Qwen3.6-35B-A3B 模型的量化版本,命名为 nvidia/Qwen3.6-35B-A3B-NVFP4。该模型使用 NVFP4 数据类型,将内存需求减少约 3.06 倍,同时在各种基准测试中保持了有竞争力的性能。它针对 AI 代理系统、聊天机器人和 RAG 系统进行了优化部署,并已准备好商用。