Multi-Token Prediction (MTP)
PulseAugur coverage of Multi-Token Prediction (MTP) — every cluster mentioning Multi-Token Prediction (MTP) across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Tencent 发布 Hy3,一个开放的 295B MoE 模型,支持 256K 上下文
Tencent 发布了 Hy3,一个开源的 2950 亿参数专家混合(MoE)模型,专为复杂推理、代理工作流和长上下文任务而设计。该模型每个 token 只激活 210 亿参数,在保持效率的同时支持 256K 的上下文窗口。Hy3 在编码、STEM 和推理任务等各种基准测试中表现出色,并经过特定训练以提高工具调用中的可靠性、减少幻觉并增强多轮意图跟踪。该模型可通过兼容 OpenAI 的 API 访问,并提供 `reasoning_ef…
-
ai-sage 发布 4320 亿参数的 GigaChat 3.5 Ultra
ai-sage 发布了 GigaChat 3.5 Ultra,这是一款拥有 4320 亿参数的混合专家模型,专为多语言任务、推理和代码生成而设计。与前代 GigaChat 3.1 Ultra 相比,新版本体积缩小了约 40%,同时在编码和数学场景下性能有所提升。GigaChat 3.5 Ultra 采用混合注意力架构,结合了多头潜在注意力 (Multi-head Latent Attention) 和门控 Delta 网络 (Gate…
-
Gemma 4 MTP 和 QAT 提升本地 LLM 速度
“本地运行 LLM”项目的最新更新引入了 Gemma 模型的 MTP(多令牌预测),在令牌生成方面实现了高达 90% 的速度提升。这种优化与 QAT(量化感知训练)相结合,显著提高了本地 LLM 执行的性能。此外,通过配置调整,提示大小减少了 60%,并实现了所有提示的日志记录。