PulseAugur
实时 05:44:44
实体 WikiText-2

WikiText-2

PulseAugur coverage of WikiText-2 — every cluster mentioning WikiText-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 19
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_215748 ·

    新的IPZO方法增强了IMC加速器上的SNN微调

    研究人员开发了一种名为隐式扰动ZO(IPZO)的新方法,以提高在内存计算(IMC)加速器上微调脉冲神经网络(SNN)的效率。该方法通过减少冗余操作和扰动生成的硬件需求,解决了不可微SNN的梯度估计限制。提出的PGU-XOR技术是IPZO的关键组成部分,在硬件上显著降低了面积和能量开销的同时,展示了与基于软件的方法相当的准确性。

  2. TOOL · CL_206313 ·

    Transformer LM 头压缩:有害瓶颈还是几何压缩?

    研究人员调查了 Transformer 中的语言模型头是否会造成有害的梯度瓶颈。他们使用 WikiText-2 模型进行仅后向干预的实验,发现减小输入 Transformer 的梯度的秩实际上会增加验证损失。相反,具有同等减小秩的因子化前向头会导致损失更大幅度地增加。这些发现表明,虽然发生了强烈的几何压缩,但这可能并非一个有害的优化瓶颈。

  3. TOOL · CL_191133 ·

    新的分块SVD方法直接从权重中提取网络机制

    研究人员开发了一种名为列分块SVD的新方法,可以直接从神经网络中的线性位提取可用的权重机制。该方法识别网络权重本身的概念,而不是依赖外部代理词典。该方法在Gemma-2-2B上使用WikiText-2进行了评估,在所有测试的线性映射中均获得满分182/182,其中特定的映射在残差写入方面显示出完整的A/B/C评分。

  4. RESEARCH · CL_183287 ·

    新的大语言模型研究致力于加速训练、领域适应和推理效率

    多篇在 arXiv 上发表的研究论文探索了优化大语言模型(LLM)训练和推理的新方法。A-3PO 提出了一种近似策略优化方法,以加速 LLM 训练;Diffract 通过检查权重矩阵和注意力头来分析领域适应;ZeroLock 引入了一种无反向传播算法,用于内存高效的 LLM 训练;DistillCache 使用强化学习进行推理过程中的自适应 KV 缓存驱逐。其他研究则侧重于通过采样多样性提高 LLM 推理性能,防范针对 KV 缓存的侧…

  5. TOOL · CL_174100 ·

    新的SCSE方法改进了用于文本任务的循环Transformer

    研究人员引入了以源为中心的态演化(SCSE),这是一种旨在增强循环Transformer的新颖方法。SCSE通过确保精确的锚点不变性,解决了在不同循环深度下保持一致的隐藏状态的挑战。这种方法允许输入条件化,同时保留参考点,从而在文本补全和迁移学习等任务上提高了性能。

  6. TOOL · CL_167171 ·

    新的TriSP方法在保持性能的同时显著剪枝LLM

    研究人员开发了TriSP,一种用于大型语言模型的新型结构化剪枝方法,旨在降低其计算和内存成本。TriSP结合了权重幅度、激活范数和梯度敏感性,以创建通道级重要性得分。当与自适应层预算分配和LoRA恢复配对时,TriSP在LLaMA-7B模型上表现出卓越的性能,实现了更低的困惑度和更高的准确性,同时显著提高了推理吞吐量。

  7. RESEARCH · CL_165163 ·

    新研究探索用于LLM的优化LoRA微调方法 · 跟踪4个来源

    研究人员正在探索优化低秩适配(LoRA)以微调大型语言模型的新方法。一种方法,统一LoRA(ULoRA),引入了一个可预训练梯度初始化的连续体,该连续体可以针对特定任务进行调整,潜在地匹配或超越完全微调的性能。另一种方法,Manifold-LoRA,将LoRA重新表述为流形优化问题,使用无回缩算法来加速训练并提高下游性能。此外,一种相似性度量方法侧重于仅微调最相关的层,在性能损失最小的情况下将可训练参数减少多达50%。最后,一个称为“…

  8. RESEARCH · CL_133157 ·

    PALS方法通过调整层级稀疏性来改进LLM剪枝

    研究人员开发了PALS(Percentile-Aware Layerwise Sparsity),一种用于剪枝大型语言模型的新颖方法。与现有的应用统一稀疏性的一次性方法不同,PALS根据激活幅度动态调整每层的稀疏性比例。这种方法在LLaMA-2-7B的困惑度方面显示出显著的改进,取得了比统一剪枝方法更好的结果。然而,其益处依赖于架构,LLaMA-3-8B仅显示边际收益,而Mistral-7B则没有显示任何收益。

  9. RESEARCH · CL_128786 ·

    新的LLM压缩技术利用了先进的数学和图像适应性

    研究人员正在开发先进的大型语言模型(LLM)压缩技术,以降低其计算和存储需求。一篇论文介绍了Leech Lattice Vector Quantization (LLVQ),该技术利用高维格进行最优球体打包,以实现最先进的压缩性能。另一种方法LACE-SVD使用有损奇异值分解和累积误差校正,在保持模型精度的同时提高压缩率。对于图像压缩,LUMI框架提供了一种与分词器无关的方法,使用冻结的LLM骨干网络,将像素数据适应LLM的嵌入空间,…

  10. TOOL · CL_117477 ·

    新方法使用嵌入式度量知识图谱间的语义相似性

    研究人员开发了一种新方法来衡量知识图谱(KGs)之间的语义相似性,解决了现有方法主要关注实体、关系和三元组的局限性。所提出的技术通过比较知识图谱的底层信息来评估图级别语义,而不是仅仅依赖结构模式。使用从文本文档派生的自定义语义匹配数据集进行的实验表明,新的基于知识图谱嵌入的方法,特别是EmbPairSim评分函数,在捕获图对图语义相似性方面优于Sentence-BERT等传统方法。

  11. TOOL · CL_93123 ·

    CONCORD 框架通过异步稀疏聚合增强设备-云 RAG

    研究人员推出 CONCORD,一个旨在优化设备-云协作设置下的检索增强生成(RAG)的新框架。在该设置中,私有文档保留在本地设备上,而公共知识则驻留在云端。这种方法解决了现有 RAG 方法的局限性,这些方法依赖于频繁同步和密集证据传输,在实际网络条件下可能效率低下。CONCORD 采用异步稀疏聚合,将云视为间歇性的证据来源而非持续的协作者。它使用等待债务控制来管理云参与,并使用证书引导机制仅请求必要的远程证据,从而在保持答案质量的同时…

  12. RESEARCH · CL_93580 ·

    新的LiFT框架使用线性规划来控制Transformer过拟合

    研究人员推出了一种新颖的Transformer模型微调框架LiFT,该框架利用线性规划来控制过拟合。该方法将微调表述为一个双层优化问题,联合更新模型参数和正则化超参数。通过求解线性规划,LiFT识别出一种面向验证的下降方向以进行集中更新,从而减少了广泛重新训练的需求。在WikiText-2上对GPT-2 Small进行的实验表明,LiFT能够有效地调整Transformer块和正则化参数,尤其是在易于过拟合的情况下,提高了测试困惑度。

  13. RESEARCH · CL_79133 ·

    Chiaroscuro Attention 通过动态令牌路由优化 Transformer 计算

    研究人员开发了 CHIAR-Former,这是一种新颖的 4 层 Transformer 模型,通过动态路由令牌来优化计算使用。CHIAR-Former 不会统一应用自注意力,而是分析令牌的频谱熵,将每个令牌导向三个算子之一:DCT 频谱混合、RBF 核混合或全自注意力。这种方法在大型自然语言文本上显著提高了性能,在 WikiText-103 上实现了 45% 的困惑度改进,同时注意力 FLOPs 比标准 Transformer 减少…

  14. RESEARCH · CL_53609 ·

    Kan Extension Transformers 统一了注意力、扩散和自条件化

    研究人员推出了一种名为 Kan Extension Transformers (KETs) 的新框架,该框架通过范畴论的视角统一了各种 Transformer 实现。KETs 将 Transformer 层视为加权的结构化扩展算子,涵盖了标准注意力、Geometric Transformers 和高阶单纯形情况。该框架还连接到扩散式补全,并通过作用于分离的预测载体来引入自条件机制,从而在不泄露未来 token 的情况下揭示非因果结构。…

  15. TOOL · CL_39127 ·

    Llama 3.1 8B 基准测试揭示 Apple M4 上的内存带宽瓶颈

    在 Apple M4 Mac Mini(配备 16GB 统一内存)上对 Llama 3.1 8B 进行的基准测试显示,尽管 Q8_0 量化模型完全适合内存,但由于内存带宽限制,其 token 生成速度仍然很慢。分析表明,8 位权重占用了内存总线,导致 GPU 大部分时间用于数据传输而非计算。研究确定 Q4_K_M 是一个实用的最佳选择,它提供的质量几乎与 Q8_0 相同,但速度显著更快,且不会触发交换。

  16. RESEARCH · CL_36932 ·

    新的ScaleSearch方法通过优化量化提高了生成模型的效率

    研究人员开发了一种名为ScaleSearch的新方法,通过量化来提高生成模型的效率。该技术优化了块浮点(BFP)格式中尺度因子的选择,将量化误差降低了高达27%。提出的ScaleSearchAttention算法与BFP集成,在因果语言建模中表现出接近零的性能损失,并在Qwen3-8B和Llama 3.1 70B等模型的准确性方面显示出显著的改进。

  17. TOOL · CL_28353 ·

    新的BCJR-QAT方法将LLM量化推向每权重2比特

    研究人员开发了BCJR-QAT,一种将大型语言模型量化到每权重2比特的新颖方法,这是超越当前训练后量化技术的重大进展。这种新方法使用了维特比算法的可微分松弛,实现了量化感知训练,并在WikiText-2等基准测试中取得了更好的困惑度得分。该方法已被证明可以改进Llama-3.2-1B等模型的性能,显著优于现有方法。

  18. RESEARCH · CL_21794 ·

    新参数E可预测混合专家模型健康状况,防止专家失效。

    研究人员引入了一个新的无量纲控制参数 E = T*H/(O+B),用于预测混合专家(MoE)模型中专家生态系统的健康状况。该参数源自四个超参数,可以在无需手工设计的负载均衡损失的情况下防止“死专家”。在视觉和语言任务上的实验表明,E 值达到 0.5 或更高即可维持健康的专家生态系统,为 MoE 训练提供了一个统一的诊断工具。

  19. TOOL · CL_20375 ·

    新的MetaAdamW优化器使用自注意力实现自适应学习率

    研究人员开发了MetaAdamW,这是一种新颖的优化器,通过采用自注意力机制来增强自适应学习率和权重衰减。这种基于Transformer的方法根据统计特征动态调整不同参数组的超参数,旨在克服AdamW等优化器中统一设置的局限性。跨不同任务的实验表明,MetaAdamW的性能持续优于AdamW,缩短了训练时间或提高了性能。

  20. RESEARCH · CL_10083 ·

    Associative-State Universal Transformers 通过稀疏检索提高参数效率

    研究人员开发了 UniMatrix,一种将结构化递归与稀疏检索机制相结合的新型通用 Transformer 架构。虽然早期版本在 WikiText-2 等标准语言建模任务上显示出参数效率和具有竞争力的性能,但它们在联想回忆方面存在困难。随后的迭代 UniMatrix-SparsePointer,通过引入稀疏槽路由和指针-logit 融合,显著提高了联想回忆的准确性,在特定基准测试上以比传统 Transformer 更少的参数实现了近乎完美的性能。