PulseAugur
实时 21:17:54
实体 Multi Token Prediction

Multi Token Prediction

PulseAugur coverage of Multi Token Prediction — every cluster mentioning Multi Token Prediction across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
18
90 天内 91
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.60

Further research will focus on mitigating MTP's VRAM overhead and improving acceptance rates

The recent technical blog post highlights MTP's performance issues stemming from low acceptance rates and KV cache thrashing, while another piece notes its increased VRAM demands. Future development will likely prioritize algorithmic improvements to reduce these overheads, making MTP more efficient and broadly applicable.

observation resolved confirmed 置信度 0.70

MTP's VRAM requirements are a significant bottleneck for widespread adoption on consumer hardware

A new MTP technique is noted to accelerate token generation but requires significantly more VRAM. This, coupled with the mention of MTP optimizations on a high-end RTX 3090 Ti, suggests that VRAM limitations will be a primary hurdle for MTP's accessibility and performance on typical consumer-grade GPUs, potentially limiting its impact outside of enthusiast or professional setups.

hypothesis resolved confirmed 置信度 0.65

MTP optimization will be integrated into mainstream LLM deployment frameworks within 6 months

Recent evidence shows MTP being integrated into llama.cpp and Ollama, with performance boosts reported for Qwen models. As MTP demonstrates significant speed improvements for local inference, it's likely to be adopted by other popular LLM deployment frameworks to enhance user experience and efficiency.

查看全部假设 →

最近 · 第 1/5 页 · 共 91 条
  1. SIGNIFICANT · CL_217028 ·

    阿里巴巴 Qwen3.8-27B 采用混合注意力技术,实现高效长上下文处理

    阿里巴巴通义实验室发布了 Qwen3.8-27B,这是一款拥有 277.8 亿参数的多模态模型,采用了新颖的混合注意力架构。该设计通过一种名为 Gated DeltaNet 的线性注意力机制,策略性地将每四层注意力中的三层替换掉,仅保留关键层使用全注意力。这种方法显著降低了内存压力和计算成本,使模型能够处理 262,144 个 token 的原生上下文窗口,并通过 YaRN 缩放可扩展至约一百万个 token,同时还能容纳在一块高端消…

  2. TOOL · CL_215529 ·

    Qwen3.8-27B 模型在 Strix Halo 硬件上实现 21.23 tok/s

    一位用户分享了 Qwen3.8-27B 模型在 Strix Halo 硬件上使用 Q4 量化运行的性能指标。基准测试显示,在 96 个请求中,中位数推理速度为每秒 21.23 个 token,最大序列长度 (n-max) 为 4。这些数据在一个多 token 预测 (MTP) 矩阵中呈现。

  3. TOOL · CL_215347 ·

    MTPLX 和 llama.cpp+MTP 在 macOS 上运行 Qwen3.8-27B 的基准测试中领先

    Reddit r/LocalLLaMA 版块的一位用户进行了广泛的基准测试,以确定在 macOS 上运行 Qwen3.8-27B 模型最快、最高效的引擎。经过五天和超过 100 小时的 GPU 测试,该用户发现 MTPLX 和支持 MTP(Metal Tensor Parallelism)的 llama.cpp 在代理编码任务方面提供了最佳性能。基准测试包括简短的合成测试、复杂的、多阶段的代理编码挑战以及预填充速度测试。

  4. TOOL · CL_211624 ·

    Ornith 1.5 35B A3B 模型发货时 MTP 头未经训练,导致性能缓慢

    Ornith-1.5-35B-A3B 大型语言模型之所以出现性能问题,是因为它在分发时配备了一个未经训练的多令牌预测 (MTP) 头。这个对模型输出至关重要的头是随机初始化的,并且没有经过任何训练。正如用户报告以及在 HuggingFace 上进行的调查所示,这一疏忽是导致模型性能异常缓慢的直接原因。

  5. TOOL · CL_210854 ·

    建议 Qwen3.8-27B 用户禁用 MTP 以提高稳定性

    Qwen3.8-27B 模型用户在使用多令牌预测 (MTP) 功能时,可能会遇到诸如无限循环或重复文件检查等问题。建议禁用 MTP 作为解决方案,并指出此更改不会影响模型的根本推理或编码能力,因为 MTP 主要作为一项速度优化功能。

  6. TOOL · CL_204773 ·

    llama.cpp 引入自适应 MTP 并采用语义化版本控制

    llama.cpp 的一项新拉取请求引入了自适应多令牌预测 (MTP) 模式,旨在动态调整 MTP 深度以获得最佳性能。虽然常规文本生成速度可能会略有下降,但在编码任务和回忆对话早期信息方面速度显著提高,最高可达 50%。建议使用特定的配置设置来启用自适应 MTP,以允许动态深度范围。另外,llama.cpp 已过渡到语义化版本控制,并发布了其首个正式版本 v0.1.0。

  7. TOOL · CL_204772 ·

    本地 LLM 用户优化 llama.cpp 以提高速度和上下文

    一位用户详细介绍了他们为本地 LLM 推理优化 llama.cpp 的经验,在他们的硬件上实现了显著的性能提升和更大的上下文窗口。他们报告称生成速度提高了 70%,预填充速度提高了 40%,从而能够利用 Qwen 3.8-27B 模型的全部 262k 上下文窗口。用户还发现并报告了一个与多 GPU 设置下的多令牌预测 (MTP) 性能相关的错误,同时指出 Thunderbolt 4 为他们的配置提供了可接受的带宽和延迟。

  8. TOOL · CL_214818 ·

    新的多字节预测加速了分层语言模型

    研究人员开发了一种称为多字节预测(MBP)的新方法,以加速字节级分层语言模型的推理速度。MBP并行生成多个字节,在多令牌预测(MTP)范例的基础上进行了创新,例如可变长度预测窗口和新颖的注意力掩码方案。这种方法允许并行字节预测而不损害因果关系,在包括指令遵循、问答、摘要和机器翻译在内的各种生成任务中实现了性能和推理吞吐量之间的帕累托最优平衡。

  9. RESEARCH · CL_205958 ·

    新的多字节预测技术加速了分层语言模型

    研究人员开发了一种称为多字节预测(MBP)的新技术,以加速字节级分层语言模型的推理速度。该方法并行生成多个字节,克服了单字节生成的瓶颈,而无需额外的参数或显著影响性能。MBP 在各种生成任务中被证明在性能和推理吞吐量之间提供了最佳平衡。

  10. COMMENTARY · CL_197490 ·

    社区讨论 Qwen 3.8-27B 模型技术细节

    Reddit 的 r/LocalLLaMA 社区正在讨论即将发布的 Qwen 3.8-27B 模型的技术规格。用户们正在争论该模型将采用多令牌预测 (MTP) 还是 DFlash 头部,其中一位用户指出,采用 MTP 的 3.6 27B 版本在其系统上实现了大约 8 tokens/秒的性能。尽管与更大模型相比可能存在性能限制,但对新发布的期待显而易见。

  11. TOOL · CL_190151 ·

    llama.cpp 补丁将 AMD GPU 上的 Qwen 上下文长度提升至 149K

    Reddit 上的一位用户为 llama.cpp 开发了一个补丁,显著增加了在 AMD GPU 上运行的模型上下文长度。通过优化多令牌预测 (MTP) 缓冲区分配,该补丁使 Qwen 27B 模型的上下文长度最高可达 149K 个令牌,远高于默认的 64K。此优化对于具有多个 GPU 的 ROCm 配置尤其有利,与 Vulkan 后端相比,它提供了更好的性能和更长的上下文长度,尽管 Vulkan 仍然提供一些显存节省。

  12. TOOL · CL_189878 ·

    据报道 DeepSeek-V4-Flash 在 DSpark 草稿模型配置下存在性能问题

    Reddit r/LocalLLaMA 版块的一名用户在使用 DSpark 草稿模型配置时,发现 DeepSeek-V4-Flash 模型的性能明显低于 Multi Token Prediction (MTP) 设置。MTP 配置可达到每秒 30-40 个 token 的可观速度,而 DSpark 配置则降至每秒仅 1-2 个 token。该用户正在寻求关于如何正确配置 llama-server 的推测解码以解决此瓶颈的建议,并提供了…

  13. TOOL · CL_183274 ·

    LoopMTP 引入循环 Transformer 和多词预测,以增强推理能力

    研究人员推出 LoopMTP,这是一种新颖的循环 Transformer 架构,旨在以参数高效的方式增强推理能力。该模型在多次迭代中重复使用单个层堆栈,有效地模仿了更大模型的深度。LoopMTP 结合了多词预测来指导中间表示,将循环迭代与未来词预测对齐,并将准确率提高了高达 8.1%,优于基线模型。

  14. TOOL · CL_180465 ·

    新的AdaMTP范式通过自适应预测改进LLM训练

    研究人员推出AdaMTP,这是一种旨在改进大型语言模型多令牌预测(MTP)的自适应训练范式。与使用固定预测范围的现有MTP框架不同,AdaMTP根据序列的可预测性动态调整预测长度,并使用基于熵的分割算法来识别语义边界。这种方法旨在减轻可能损害模型核心能力的噪声训练信号和梯度干扰。在Llama-3.1-8B、Qwen 2.5 7B和Gemma-3-12B模型上的实验表明,AdaMTP在各种基准测试中提高了性能和推理速度。

  15. TOOL · CL_178890 ·

    llama.cpp 为 Qwen3-Next 模型添加 MTP 支持

    开源项目 llama.cpp 发布了 b10238 版本,为 Qwen3-Next 大语言模型增加了多触角感知 (MTP) 支持。此次更新使得在消费级硬件(包括 CPU 和 GPU)上更高效地进行 Qwen3-Next 的本地推理成为可能。该版本还包含对 Python 类型检查和 MTP 层计算的持续改进,展示了 llama.cpp 在快速集成和优化新的开源模型以供本地执行方面的承诺。

  16. TOOL · CL_177448 ·

    llama.cpp 为 DeepSeek-V4 Flash 添加了 MTP 和 DSpark 支持

    llama.cpp 项目已集成对 Multi Token Prediction (MTP) 和 DSpark 的支持,特别是针对 DeepSeek-V4 Flash 模型。此增强功能可实现对更长序列的更有效处理,并可能在某些语言生成任务中提高性能。此次更新通过向 llama.cpp 存储库提交拉取请求完成,使用户能够利用 DeepSeek-V4 Flash 模型的新功能。

  17. TOOL · CL_171576 ·

    llama.cpp 现在默认加载 MTP 张量,增加了资源使用量

    流行的开源推理引擎 llama.cpp 已更新其默认行为,以自动加载多令牌预测 (MTP) 张量。此更改会影响内置 MTP 张量的模型,例如 GLM-5.2、hy_v3、qwen35moe 和 step35。以前,只有在明确启用推测解码时才会加载这些张量。现在,它们将默认加载,即使您不使用 MTP 功能,也可能会增加用户的 VRAM 和 RAM 使用量。

  18. TOOL · CL_167514 ·

    研究论文详细介绍了多令牌预测如何帮助 Transformer 进行规划

    一篇新研究论文探讨了多令牌预测(MTP)如何使 Transformer 比标准的下一令牌预测(NTP)更有效地执行规划和推理任务。研究表明,在图路径查找和 Countdown 等推理基准测试中,MTP 的表现优于 NTP。理论上,MTP 通过首先关注结束节点来鼓励路径的向后重建,这一过程得益于梯度解耦特性,该特性提供了更清晰的训练信号。

  19. RESEARCH · CL_160856 ·

    Windowed-MTP 优化百万token上下文的投机解码

    研究人员开发了 Windowed-MTP,一种优化语言模型大上下文窗口投机解码的新技术。该方法通过应用滑动窗口和注意力汇聚点,解决了在百万token上下文下草稿头注意力机制成为瓶颈的问题。Windowed-MTP 无需训练且无损,确保目标模型的输出分布不变。在 Qwen GDN-MoE 和 Mamba2-hybrid 模型上的测试表明,每解码步成本和端到端延迟均显著降低。

  20. TOOL · CL_155369 ·

    Mythos 增强型编码模型通过 llama.cpp 和 Raspberry Pi 在本地运行

    新的编码模型 Qwythos-9B-Claude-Mythos-5-1M 现在可以使用 llama.cpp 在本地运行。此设置允许用户将模型连接到 Raspberry Pi 编码代理并构建快速的本地编码工作流。该过程利用了多令牌预测 (MTP) 推测解码和 OpenAI 兼容 API 来提高性能。