PulseAugur
实时 11:59:45
实体 GPT-2 Medium

GPT-2 Medium

PulseAugur coverage of GPT-2 Medium — every cluster mentioning GPT-2 Medium across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_218083 ·

    新方法解决语言模型的选择性遗忘问题 · 跟踪到2个来源

    研究人员正在开发用于语言模型选择性遗忘的高级技术,以在不降低整体性能的情况下删除特定数据。一种名为GRAPHSU的方法使用图引导方法,通过在相关训练样本中传播删除压力来扩大删除范围,超出最初的“遗忘种子”。另一个提出的框架,Deep Contrastive Unlearning for fine-Tuning (DeepCUT),专注于优化模型的潜在空间来实现遗忘。这两种方法都旨在解决与训练数据相关的隐私和版权问题,同时保持模型的效用。

  2. RESEARCH · CL_185428 ·

    新研究探讨MUON优化器的收敛性并提出MALT扩展

    两篇新研究论文探讨了MUON优化算法,这是一种用于训练大型语言模型的方法。第一篇论文介绍了MALT,它是MUON的一个扩展,通过轻量级的对角预处理来提高对损失曲面曲率各向异性的鲁棒性。MALT旨在保持MUON的效率,同时提高其性能,这在GPT-2模型的实验中得到了证明。第二篇论文分析了MUON的收敛特性,表明它可能无法收敛于某些随机优化问题,并对该算法的广义变体进行了误差分析。

  3. RESEARCH · CL_169569 ·

    新研究解决了掩码扩散语言模型的评估和架构问题

    两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。

  4. RESEARCH · CL_143678 ·

    新的fMRI解码方法显示语言模型掩盖了失败

    研究人员开发了一种从fMRI信号解码连续语言的新方法,通过扩展体素选择和更先进的语言模型来改进现有的编码流程。他们还引入了fMRIFlamingo,一个将大脑活动映射到冻结的Llama-3.2-1B模型的系统。然而,严格的测试显示,明显的解码成功在很大程度上是由于语言模型自身的先验知识,而不是神经输入,这突显了对此类系统进行仔细评估的必要性。

  5. RESEARCH · CL_91397 ·

    全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展

    研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…

  6. RESEARCH · CL_06744 ·

    AutoCompress 方法隔离关键 Transformer 层以实现高效压缩

    研究人员开发了 AutoCompress,一种通过隔离和保留关键的第一层(第 0 层)来压缩 Transformer 模型的新颖方法。这种称为关键层隔离(CLI)的方法表明,在较小的 Transformer 中,第 0 层比其他层包含更多与任务相关的关键信息。当应用于 GPT-2 Medium 时,CLI 实现了 2.47 倍的压缩比,参数减少了 59.5%,同时在 WikiText-103 基准测试中保持了强劲的性能。