PulseAugur
实时 07:54:03
实体 Language Modeling

Language Modeling

PulseAugur coverage of Language Modeling — every cluster mentioning Language Modeling across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_218220 ·

    ViTexSZ 框架使用视觉-文本蒸馏进行脑电图癫痫检测

    研究人员开发了 ViTexSZ,一个用于从脑电图 (EEG) 数据中检测癫痫的新框架。该系统采用异构视觉-文本知识蒸馏方法,将脑电图信号转换为图像,并通过多模态大语言模型将其与临床语义对齐。ViTexSZ 在四个脑电图癫痫数据集上表现出卓越的性能,在亚临床和一般癫痫检测场景中,性能比现有方法提高了高达 12.9%。

  2. TOOL · CL_217966 ·

    量子张量网络实现生成模型的可扩展模拟

    研究人员开发了一种使用量子计算机上的张量网络模拟连续时间生成模型的新颖方法。与传统方法相比,这种方法显著降低了计算成本和存储需求,尤其适用于高维数据。该研究通过成功复现稀有事件采样的缩放比例来验证该流程,展示了其在各种应用中进行高效统计推断的潜力。

  3. RESEARCH · CL_212024 ·

    NAPE框架通过预测下一个补丁嵌入来推进音频表示学习

    研究人员推出了一种新颖的音频自监督学习框架NAPE(Next-Audio-Patch-Embedding prediction)。该方法利用因果Transformer,通过预测对数梅尔频谱图的后续补丁嵌入来从先前的嵌入中学习,并将因果掩码和停止梯度作为其主要的训练信号。NAPE在六个音频和语音基准测试中取得了最先进的微调性能,展示了随着编码器尺寸的持续扩展和强大的线性探测结果。

  4. TOOL · CL_198109 ·

    研究发现:长上下文训练可能损害大型语言模型的知识

    一篇新研究论文提出了“信息丰富悖论”,挑战了大型语言模型中更长上下文窗口总是能提高性能的假设。研究表明,训练过程中过多的相关信息会降低模型进行参数化编码知识的动力,导致过度依赖上下文。这种现象在语言建模、自然语言理解和闭卷问答任务中,超过某个中间最优值后,会降低性能。研究表明,使用信息丰富的上下文进行训练会将梯度压力从与参数化知识相关的馈送网络转移到注意力模块,从而在推理过程中增加上下文依赖性。

  5. TOOL · CL_151816 ·

    新原理解释AI模型在数据影响下仍能收敛

    一篇新论文引入了“稳定信号原理”,以解释机器学习模型在重新训练过程中如何收敛,即使它们对数据的影响很大。该原理认为,模型的收敛是由预测目标的少量、与模型无关的成分引导的,例如物品的内在质量。研究表明,通过适当的正则化,重复的风险最小化可以几何收敛到这个稳定信号,从而为语言模型在生成数据上的表现力和训练动力学提供了新的见解。

  6. RESEARCH · CL_121401 ·

    新的Transformer设计分离状态预测以提高效率

    研究人员提出了状态预测分离假说,认为在Transformer中区分下一个词预测和状态存储的作用可以提高语言建模性能。一种采用两个独立计算流来执行这些功能的新型Transformer变体,展示了改进的数据和计算效率。实验表明,与标准Transformer相比,这种方法在下游任务上持续降低了验证损失,平均性能提高了2-3个百分点。

  7. RESEARCH · CL_115231 ·

    Flexformer 引入可学习注意力核以实现高效Transformer

    研究人员推出了一种新颖的线性Transformer架构Flexformer,旨在克服传统Transformer的二次复杂度限制。Flexformer通过以数据驱动的方式学习注意力核来实现这一点,利用具有可训练频谱频率的随机傅里叶特征。这种方法具有更强的表达能力,并在语言建模和序列分类任务上展现出优于现有方法的性能。此外,Flexformer可以从预训练Transformer中蒸馏,并有望实现高效的长序列处理。

  8. RESEARCH · CL_95870 ·

    研究人员使用形式文法分析Transformer的表达能力

    一篇新研究论文通过检查深度Transformer模型表示分层结构的能力来分析其表达能力。该研究使用有界深度、非递归上下文无关文法来构建具有位置注意力的Transformer。研究结果表明,这些架构可以将抽象的语法状态编码到残差流中的线性可分子空间,支持了深度神经网络的力量来源于分层表示的假设。

  9. RESEARCH · CL_70263 ·

    Transformer 研究发现 QKV 投影共享可大幅减少内存使用

    研究人员调查了 Transformer 模型中三个独立投影(查询、键和值)的必要性。他们的研究发现,共享投影,特别是 Q-K=V 变体,可以在对性能影响极小的情况下显著减少 KV 缓存内存使用。这种方法,特别是与分组查询注意力结合使用时,可提供可观的内存节省,可能支持更高效的设备端推理。

  10. RESEARCH · CL_06711 ·

    Switch Attention 在全注意力与滑动窗口注意力之间动态路由

    研究人员引入了 Switch Attention (SwiAttn),这是一种新颖的混合Transformer架构,旨在解决长上下文语言建模中标准全注意力机制的计算瓶颈问题。SwiAttn 动态地将每个 token 的计算路由到用于全局上下文的全注意力分支或用于局部模式的滑动窗口分支,从而实现更有效的资源分配。该方法通过持续预训练进行了优化,并在常规和长上下文长度的众多基准测试中进行了测试,证明了其有效性。