n-gram
PulseAugur coverage of n-gram — every cluster mentioning n-gram across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
APEX系统通过自适应推测解码优化LLM推理
研究人员开发了APEX,一个旨在提高大型语言模型推理效率的新系统。APEX采用了一个学习型控制器,该控制器根据生成文本的可预测性动态调整推测解码策略。它从多种推测方法中进行选择,包括EAGLE-3等专家模型和n-gram方法,并在每个验证步骤中调整token草稿的深度。这种自适应方法旨在减少计算浪费并提高推理速度,与传统的自回归解码相比实现了显著的加速。
-
开发者探索基于CPU的代码补全的自适应混合
一位开发者创建了一个名为pycomplete的代码补全工具,该工具可在笔记本CPU上运行。该工具通过混合n-gram模型、缓存和一个小型Transformer来预测下一个token,混合常数为固定的0.45。实验探索了每个位置可变的混合常数,显示一个Oracle可以将Top-1准确率提高7.05%,但尝试使用缓冲区长度或其他表格策略等特征来捕获路由信号未能带来显著收益。研究表明,测试的特征不携带模型混合的路由信号。
-
研究人员探索使用n-gram技术的小型AI模型
一位Reddit r/LocalLLaMA板块的用户正在询问是否存在利用n-gram或en-gram技术训练的实验性小型语言模型(90亿参数或以下)。用户注意到Hugging Face上缺乏此类模型,并表示有兴趣比较在相同数据集上使用和不使用n-gram训练的小型模型的性能。
-
人工智能分析语音和语言以检测老年人的孤独感
研究人员开发了一个多模态框架,通过分析语音和语言模式来检测老年人的孤独感。该研究涉及 310 名老年人,结合了心理语言学词典和主题模型等语言特征以及音高和语调等声学特征。研究结果表明,孤独感越强与否定词和冲突相关语言的使用增加相关,而孤独感越低则与更多的社交引用和语音中的情感丰富度相关。与仅文本或仅音频的方法相比,多模态模型表现出更优越的性能,表明其作为心理评估补充工具的潜力。
-
新研究揭示代码水印易受混淆攻击;OpenStamp 提供稳健替代方案
研究人员发现当前AI生成代码的水印方法存在重大漏洞,证明常见的代码混淆技术可以有效消除基于N-gram的水印。另一项研究介绍了OpenStamp,一种专为开源语言模型设计的新水印技术,它将信号直接嵌入模型权重中,使其更能抵抗通过微调或释义进行的移除。
-
讨论了Transformer之外的人工智能模型架构创新
Reddit的r/LocalLLaMA论坛上的一场讨论,探讨了在N-gram和量化等广为人知的进展之外,人工智能模型潜在的架构创新。用户正在寻求关于大型语言模型或其他人工智能架构可能代表重大未来发展的根本性变革的见解。人们对Mamba类架构作为传统Transformer的替代方案表现出特别的兴趣,并呼吁解释其潜力和其他激进的理论化变革。
-
提出新的 AI 基准污染指标以应对释义
提出了一种评估 AI 模型污染的新方法,该方法侧重于基准测试与其训练语料库之间的 N-gram 重叠度。当前方法测量精确字符串匹配,可能具有误导性,因为模型可以回忆起释义或重写内容中的信息,而这些信息不会被 N-gram 分析标记。所提出的方法建议在污染分数旁边报告模型的召回能力,以更准确地评估基准完整性。
-
N-gram 与专家模型:理解大语言模型架构的权衡
一篇Reddit帖子解释了大语言模型中n-gram和专家混合(MoE)架构的区别。MoE模型通过选择特定的前馈网络块来执行推理任务,而n-gram则作为局部短语的记忆回忆机制。该帖子指出,n-gram可以分担高达约25%的模型参数,并建议将这些参数存储在SSD而非RAM上可以提高性能。这种混合方法,以Qwen 3.8 Flash Next (Qwen4Exp)为例,通过在每个token激活一小部分参数,同时利用整个训练模型,从而实现更…
-
N-gram表或可实现单服务器上的海量AI模型
Reddit上的一个讨论探讨了n-gram表对AI格局的潜在影响。用户推测,n-gram表可能使拥有超过万亿参数的模型在配备大量内存和中等GPU的单台服务器上运行,而无需依赖庞大的GPU服务器集群。这有可能加速自托管AI模型与旗舰AI模型之间能力差距的缩小。
-
代码补全工具的幽灵文本功能因自预测差距而评估失败
一位开发者创建了一个名为 pycomplete 的代码补全工具,该工具结合了 transformer 模型、n-gram 模型和缓存。虽然该工具的下一个 token 预测准确率为 54.6%,但其生成“幽灵文本”(多 token 续写)的性能却显著下降至 7%,即十四次尝试中只有一次正确补全。这种差异的出现是因为评估指标是基于人类编写的代码进行训练的,而幽灵文本功能依赖于模型预测其自身生成的输出,这导致在评估这种不同分布时出现性能断崖。
-
研究发现:类N-gram模型比Transformer模型更能预测阅读时间
一篇新论文提出,传统的类N-gram语言模型可能比复杂的Transformer模型更能预测自然阅读时间。研究表明,虽然Transformer模型在预测下一个词方面表现出色,但其概率与阅读时间指标的相关性不如简单的N-gram统计数据。研究发现,预测结果最接近N-gram概率的神经网络语言模型,也能最佳预测自然文本的眼动追踪数据。
-
DeepSeek 的 Engram 模块实现了 Tokenizer 无关性
研究人员在 DeepSeek 的原始设计基础上,为大型语言模型开发了一个 Tokenizer 无关的 Engram 模块。新方法用多项式哈希取代了基于 XOR 的哈希,创建了一个联合嵌入空间,允许 Engram 嵌入在具有不同 Tokenizer 的模型之间重用。此修改实现了字节等价 Token 序列的哈希等价性,在保持可比性能的同时提高了 Engram 嵌入的可重用性。
-
Qwen3.6-27B 基准测试显示 DFlash 在推测解码速度方面领先
最近的一项基准测试在 vLLM 和 SGLang 框架上,使用 Qwen3.6-27B 模型和单块 RTX PRO 6000 Max-Q GPU,对推测解码方法进行了比较。结果显示 DFlash 方法最为有效,在 SGLang 上速度提升高达 3.3 倍,在 vLLM 上提升 2.5 倍,尤其在数学推理任务上表现出色。MTP/NEXTN 等其他方法显示出适度的提升,EAGLE3 的性能趋于平稳,而 ngram 的改进则微乎其微。
-
推测解码研究提升消费级硬件上LLM的推理速度
研究人员正在探索推测解码技术以加速大型语言模型(LLM)的推理。两篇论文,一篇来自arXiv,另一篇来自dev.to,详细介绍了在消费级硬件和高并发场景下提高效率的方法。arXiv论文《Lossless but Not Free》对Apple Silicon上的推测解码进行了实证分析,强调加速效果取决于并行验证以及草稿模型和目标模型之间显著的延迟差距。D-Cut论文(也来自arXiv)提出了一种用于批处理推测解码的自适应剪枝方法,该方…
-
新的推测解码方法提高了 LLM 推理速度和效率 · 跟踪 6 个来源
研究人员推出了 DominoTree,一种新颖的推测解码方法,通过使用条件树状结构显著加速 LLM 推理。该方法在 Qwen3-4B 模型上实现了高达 6.6 倍的加速,并显示出比 DDTree 和 CaDDTree 等现有技术更高的吞吐量。同时,其他研究探索了宽松的推测解码,研究速度和能力之间的权衡,并引入了 AdaptiveSD 以在 CPU 限制下实现鲁棒的、运行时自适应的推理。DSpark 是另一个框架,它将高吞吐量的并行生成…
-
新的Hamm-Grams算法通过强大的特征增强了恶意软件检测能力
研究人员开发了一种名为Hamm-Grams的新算法,旨在通过创建比传统n-grams更强大的特征来改进恶意软件的检测和分类。这些Hamm-grams是一种包含单字符通配符的正则表达式,使其不易碎。该算法使用一种新颖的局部敏感哈希和聚类技术来有效地查找常见的Hamm-grams,在识别和分类恶意软件方面显示出显著优势。