PulseAugur
中
实时 01:09:39
实体 Multi Token Prediction

Multi Token Prediction

PulseAugur coverage of Multi Token Prediction — every cluster mentioning Multi Token Prediction across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
94
90 天内 94
发布 · 30天
0
90 天内 0
论文 · 30天
17
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.60

Further research will focus on mitigating MTP's VRAM overhead and improving acceptance rates

The recent technical blog post highlights MTP's performance issues stemming from low acceptance rates and KV cache thrashing, while another piece notes its increased VRAM demands. Future development will likely prioritize algorithmic improvements to reduce these overheads, making MTP more efficient and broadly applicable.

observation resolved confirmed 置信度 0.70

MTP's VRAM requirements are a significant bottleneck for widespread adoption on consumer hardware

A new MTP technique is noted to accelerate token generation but requires significantly more VRAM. This, coupled with the mention of MTP optimizations on a high-end RTX 3090 Ti, suggests that VRAM limitations will be a primary hurdle for MTP's accessibility and performance on typical consumer-grade GPUs, potentially limiting its impact outside of enthusiast or professional setups.

hypothesis resolved confirmed 置信度 0.65

MTP optimization will be integrated into mainstream LLM deployment frameworks within 6 months

Recent evidence shows MTP being integrated into llama.cpp and Ollama, with performance boosts reported for Qwen models. As MTP demonstrates significant speed improvements for local inference, it's likely to be adopted by other popular LLM deployment frameworks to enhance user experience and efficiency.

查看全部假设 →

最近 · 第 1/6 页 · 共 109 条
  1. TOOL · CL_285571 ·

    llama.cpp 添加 GLM5-Next MTP 优化和 GGUF 加载

    llama.cpp 项目发布了更新 b11474,为 GLM5-Next 模型引入了重要的优化和功能。此次更新包括实现了一个多令牌预测 (MTP) 图,称为 NextN,通过修剪不必要的计算来提高效率。这些更改还解决了提取合同和共享尾部回滚问题,并引入了加载仅 MTP 或仅 trunk 的 GGUF 文件的能力,从而允许加载草稿模型。

  2. TOOL · CL_277054 ·

    开发者使用 llama.cpp 为 512K 上下文调整 Qwen 3.8 27B

    一位开发者详细介绍了使用 llama.cpp 在本地运行 Qwen 3.8 27B 语言模型的自定义配置。该设置侧重于最大化系统资源,特别是在 MBP M5 上的 128 GB 统一内存,以实现 512K token 的上下文窗口。调整的关键参数包括用于更快 token 生成的推测解码、将大部分模型层卸载到 GPU,以及为多代理编码任务优化批处理和 CPU 使用。

  3. TOOL · CL_276847 ·

    MTP 将大语言模型生成速度提升 56%,但引发了质量担忧

    在一台 RTX 3090 显卡上,使用 Qwen3.8-27B 模型进行了一项评估多模态预测 (MTP) 对大语言模型性能影响的实验。启用 MTP 后,生成吞吐量提高了 56%,部分任务速度提升了 20-40%。然而,一项特定的迁移任务显示出质量差异,启用 MTP 的运行生成的补丁不如标准生成正确。

  4. TOOL · CL_274985 ·

    Qwen4Exp 在 llama.cpp 中集成多令牌预测

    一个拉取请求已提交至 llama.cpp 项目,为 Qwen4Exp 模型集成多令牌预测 (MTP) 功能。此由 am17an 完成的开发允许使用带有 MTP 的 Qwen Flash Next,可能为 Qwen 3.8 27B 模型提供替代方案。集成在约 17 小时的开发后被合并。

  5. TOOL · CL_260795 ·

    Atlassian 模型 v0.4 在应用编译方面取得重大进展

    开发者发布了其 Atlassian 模型 0.4 版本,该模型基于 Qwen3.8-27B。此版本显著提高了生成有效的 Atlassian Forge 应用的能力,成功率从 0.3 版本的 12/25 个应用提高到 21/25 个。通过将训练数据集中在先前失败的应用类型和数据集中代表性不足的特定模块类型上,实现了这些改进。该模型的产物可在 Hugging Face 上公开获取,采用 Apache-2.0 许可证。

  6. TOOL · CL_252447 ·

    DFlash 扩散模型在测试中未能加速 Gemma LLM

    一种名为 DFlash 的新技术旨在通过使用通常用于图像生成的扩散模型来同时预测多个令牌,从而加速 LLM 生成。与其他专注于特定模型的方法不同,DFlash 被设计成一种通用的附加组件,可与包括 Google、MiniMax 和 Qwen 在内的各种 LLM 兼容。然而,对 Gemma-4-12B 的实际测试表明,DFlash 在速度上并未优于 Gemma 的原生 Assistant 模型。

  7. TOOL · CL_243125 ·

    大型语言模型通过多 token 预测技术加速文本生成

    多 token 预测 (MTP) 是一种旨在加速大型语言模型 (LLM) 文本生成速度的优化技术。MTP 允许模型一次性预测多个 token,而不是逐个生成。如果预测正确,则可以同时确认多个 token,从而显著加快输出速度。该方法类似于 CPU 中的推测执行,目前由 Qwen 和 Gemma 等模型支持,但实现方式有所不同。

  8. TOOL · CL_240448 ·

    Qwen3.8-27B 模型通过多令牌预测 (Multi-Token Prediction) 实现速度提升 2 倍

    对 Qwen3.8–27B-UD-Q4 模型上的多令牌预测 (MTP) 进行的基准测试显示,推理性能在 RTX 4090 上几乎翻倍,速度显著提升。研究发现,5 个令牌的草稿深度提供了速度和效率的最佳平衡,更高的值会导致性能下降。MTP 的工作原理是让一个较小的模型草拟候选令牌,然后由主模型进行验证,从而有效地在单次前向传播中处理多个令牌,而不会损害输出质量。

  9. TOOL · CL_240902 ·

    Ling模型基准测试显示MTP有所提升,但更高投机性token导致文本生成变慢

    近期对Ling模型(特别是Ling-3.0-flash)的基准测试揭示了与多token预测(MTP)和投机解码相关的性能特征。当启用MTP且n=1(每步预测一个草稿token)时,与未启用MTP的基线相比,吞吐量显著提高了约79%。然而,将'n'增加到2或3(允许更多草稿token)导致文本生成速度下降,表明在此特定配置中,更高的接受长度并未转化为更快的性能。

  10. TOOL · CL_239455 ·

    KVMem 在消费级GPU上虚拟化百万Token的AI Agent工作空间

    研究人员开发了KVMem,一个用于管理AI Agent大上下文窗口的系统,使其能够在消费级GPU上运行高达一百万Token。这种虚拟化技术将溢出的上下文存储为分页KV状态,分布在GPU内存、主机内存和NVMe中,与传统的压缩方法相比,能够更有效地处理长历史记录。KVMem已证明了提高任务成功率和交互响应能力,使得长时运行的Agent能够维护广泛的工作空间。

  11. TOOL · CL_232108 ·

    双模型文学翻译流水线在 Tesla P40 上实现每天 2-3 本书的翻译量

    一位用户详细介绍了一个利用两块 Tesla P40 GPU 进行文学书籍翻译的双模型流水线。该流水线使用 Gemma 4 - 26B-A4B 进行翻译,速度约为每秒 40 token,并使用 Qwen3.6 35B-A3B 进行校对,速度为每秒 50-70 token。该设置利用了多 token 预测 (MTP) 推测解码和 64K 上下文窗口,以实现高效、大批量的整本书翻译。

  12. TOOL · CL_228062 ·

    紧凑回滚MTP优化Qwen模型以适应低显存系统

    对llama.cpp的多令牌预测(MTP)系统进行的一项新修改,称为紧凑回滚MTP,已被开发出来以减少运行Qwen等大型语言模型的显存使用。这项优化使得显存有限的用户,例如拥有16GB显存的用户,能够更有效地运行Qwen 27B等模型。紧凑回滚MTP通过限制存储在显存中的回滚状态数量来实现这一点,从而能够实现更大的上下文窗口和提高令牌生成速度。

  13. SIGNIFICANT · CL_228024 ·

    阿里巴巴预览Qwen4,采用新颖的逐层嵌入和稀疏注意力技术

    阿里巴巴的Qwen团队发布了Qwen4-Exp,这是一个预览即将推出的Qwen4系列架构的实验模型。该模型引入了新颖的设计选择,包括逐层嵌入(PLE)和Qwen稀疏注意力(QSA),旨在在计算成本不成比例增加的情况下提高容量。PLE系统利用存储在主机RAM中的大型N-gram嵌入表,以最小的GPU影响提供显著的表示优势,并得到llama.cpp等框架的支持以进行CPU卸载。QSA通过在块级别而非令牌级别操作来提高效率,显著加快了长上下…

  14. TOOL · CL_227358 ·

    ROCm 10 通过 llama.cpp 在双 R9700 GPU 上实现 Qwen3.8 27B 模型

    一位用户成功配置了 ROCm 10 和 llama.cpp,在双 R9700 GPU 上运行 Qwen3.8 27B 模型。该设置实现了 37-50 tokens/秒 的生成速度,在生成代码时峰值超过 60 tokens/秒,展示了多令牌预测 (MTP) 的有效性。用户注意到与标准的 ROCm Docker 镜像相比,性能有所提升,并确认集成无需复杂的补丁。

  15. TOOL · CL_226897 ·

    自定义 RDNA4 内核将 Qwen3.8 性能提升高达 30 倍

    一位开发者创建了一套名为 R9V 的自定义内核,旨在优化 RDNA4 显卡的性能,特别是针对 AMD 的 R9700s。当应用于 vLLM-Radiance 推理引擎时,这些内核显著提高了 Qwen3.8-Flash-Next 等模型的速度,在某些任务中实现了高达 30 倍的性能提升。该项目还包括为密集模型开发的独立推理引擎,并提供了 Qwen3.8-Flash-Next 和 Muse Glimmer 30B 的软件包,并与 llam…

  16. TOOL · CL_224789 ·

    Qwen3.8 LLM 通过 llama.cpp 优化以实现更快的推理

    一份技术指南详细介绍了如何使用 llama.cpp 优化 Qwen3.8 大型语言模型以实现更快的推理。作者解释了如何利用张量并行和多 token 预测,在两块 RTX 3090 GPU 上实现每秒高达 75 个 token 的速度,显著优于默认的每秒 32 个 token。该指南提供了具体的标志和配置,以解决瓶颈并最大化性能。

  17. TOOL · CL_223675 ·

    LM Studio通过DFlash、DSpark和MTP优化本地AI推理

    LM Studio是一款免费的本地运行大型语言模型的应用程序,现已宣布对推理速度进行优化。此次更新包括对DFlash、DSpark和多令牌预测(MTP)技术的支持,旨在提高AI模型在用户硬件上的处理速度。

  18. TOOL · CL_221291 ·

    新的 MTAR 框架提高了自回归图像生成效率

    研究人员推出了一种新颖的训练框架 Multi-Token Autoregressive (MTAR),旨在提高自回归图像生成效率。MTAR 通过引入多令牌预测 (MTP) 以获得更强的监督,令牌级对比正则化 (TCR) 以提高表示可分离性,以及用于加速训练的语义丢弃 (SD) 来解决传统下一个令牌预测的局限性。这些组件仅在训练期间使用,不影响推理速度。在 ImageNet 上的实验表明,MTAR 在生成质量和训练效率之间取得了卓越的平…

  19. SIGNIFICANT · CL_217028 ·

    阿里巴巴 Qwen3.8-27B 采用混合注意力技术,实现高效长上下文处理

    阿里巴巴通义实验室发布了 Qwen3.8-27B,这是一款拥有 277.8 亿参数的多模态模型,采用了新颖的混合注意力架构。该设计通过一种名为 Gated DeltaNet 的线性注意力机制,策略性地将每四层注意力中的三层替换掉,仅保留关键层使用全注意力。这种方法显著降低了内存压力和计算成本,使模型能够处理 262,144 个 token 的原生上下文窗口,并通过 YaRN 缩放可扩展至约一百万个 token,同时还能容纳在一块高端消…

  20. TOOL · CL_215529 ·

    Qwen3.8-27B 模型在 Strix Halo 硬件上实现 21.23 tok/s

    一位用户分享了 Qwen3.8-27B 模型在 Strix Halo 硬件上使用 Q4 量化运行的性能指标。基准测试显示,在 96 个请求中,中位数推理速度为每秒 21.23 个 token,最大序列长度 (n-max) 为 4。这些数据在一个多 token 预测 (MTP) 矩阵中呈现。