Qwen4Exp
PulseAugur coverage of Qwen4Exp — every cluster mentioning Qwen4Exp across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
llama.cpp 优化 CUDA top-k 算法以实现显著加速
llama.cpp 项目发布了一个更新 (b11513),显著优化了 top-k 算法的 CUDA 实现。此更新用更高效的 grid-over-rows radix select 替换了 per-row DeviceTopKKernel,适用于行数较多的情况,从而大幅缩短了处理时间。例如,在 qwen4exp 模型上,使用 34,816 个 token 时,top-k 操作速度从超过 5.7 秒提高到大约 941 毫秒。该版本还根据形…
-
llama.cpp b11477 优化了跨模型的张量标志共享
llama.cpp 项目发布了 b11477 版本,该版本引入了跨不同模型处理张量标志的优化。此次更新将仅限 trunk 和仅限 MTP 模型的检测逻辑集中到 llama_model_base 中的一个辅助函数。此外,包括 DeepSeek4、nemotron-h、Qwen35、qwen35moe、qwen3next 和 qwen4exp 在内的多个模型现在支持仅限 trunk 文件,增强了兼容性和效率。
-
llama.cpp v0.6.0 为 Qwen4Exp 增加 MTP 推测解码
llama.cpp 项目发布了 0.6.0 版本,为 Qwen4Exp 模型引入了 MTP 推测解码。此次更新增强了本地大型语言模型推理引擎的性能和能力。该版本还包含许多其他改进和功能,供在自有硬件上运行模型的用户使用。
-
Qwen4Exp 优化降低了 llama.cpp 中的 indexer score 内存占用
一项拉取请求已提交至 llama.cpp 项目,以优化 Qwen4Exp 模型。此优化旨在减少 indexer score 所需的内存,可能允许 Qwen Flash Next 模型使用更少的 VRAM。此更改由 ServeurpersoCom 提出,是提高本地大型语言模型部署效率的持续努力的一部分。
-
Qwen4Exp 在 llama.cpp 中集成多令牌预测
一个拉取请求已提交至 llama.cpp 项目,为 Qwen4Exp 模型集成多令牌预测 (MTP) 功能。此由 am17an 完成的开发允许使用带有 MTP 的 Qwen Flash Next,可能为 Qwen 3.8 27B 模型提供替代方案。集成在约 17 小时的开发后被合并。
-
llama.cpp 收到 Qwen4Exp 'hc ops' 的拉取请求
一个拉取请求已提交至 llama.cpp 项目,为 Qwen4Exp 添加 "hc ops"。此次更新预计将需要对 Qwen Flash Next 模型进行重新基准测试。该贡献来自用户 am17an。
-
llama.cpp 发布更新,修复性能和稳定性问题 · 跟踪 9 个来源
llama.cpp 项目发布了多个更新,包括 0.4.1 版本,该版本解决了跨不同平台的各种性能和稳定性问题。值得注意的更改包括对 SYCL 后端的优化、CPU 堆损坏的修复以及对缺乏 BF16 硬件加速的 CUDA 设备的后备机制。这些更新旨在提高在各种硬件上运行语言模型的效率和可靠性。
-
N-gram 与专家模型:理解大语言模型架构的权衡
一篇Reddit帖子解释了大语言模型中n-gram和专家混合(MoE)架构的区别。MoE模型通过选择特定的前馈网络块来执行推理任务,而n-gram则作为局部短语的记忆回忆机制。该帖子指出,n-gram可以分担高达约25%的模型参数,并建议将这些参数存储在SSD而非RAM上可以提高性能。这种混合方法,以Qwen 3.8 Flash Next (Qwen4Exp)为例,通过在每个token激活一小部分参数,同时利用整个训练模型,从而实现更…