PulseAugur
实时 16:10:11
实体 OpenWebText

OpenWebText

PulseAugur coverage of OpenWebText — every cluster mentioning OpenWebText across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 25
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 25 条
  1. TOOL · CL_217994 ·

    新方法提高少步语言模型生成质量

    研究人员开发了一种名为解耦的自条件化(Untied Self-Conditioning)的新方法,以提高语言模型生成的质量,尤其是在使用少量采样步数时。该技术解决了先前会降低生成质量的训练-推理不匹配问题。通过抑制冗余的自条件化输入并近似步平均预测,该方法显著降低了困惑度,并提高了成对比较中的输出偏好,即使在仅使用8个采样步数的情况下也是如此。

  2. TOOL · CL_217819 ·

    ConvergeFlow 语言模型证明了收敛到令牌嵌入

    研究人员开发了 ConvergeFlow,这是一种新颖的基于流的语言模型,解决了现有连续框架中的局限性。与先前需要解码器交叉熵监督的模型不同,ConvergeFlow 将其数据预测器约束在令牌嵌入的凸包内。这种通过流匹配使用均方误差目标进行训练的方法,在理论上被证明可以收敛到有效的令牌嵌入,从而无需单独的 CE 监督解码器。在 OpenWebText 上的实验表明,ConvergeFlow 在性能上与当前的连续和离散扩散语言模型相当,…

  3. TOOL · CL_210559 ·

    单个训练示例对GPT-2的影响在预训练结束时消退

    一项新的研究论文探讨了单个训练示例对大型语言模型(特别是GPT-2)的影响。研究发现,虽然单个段落可以在接触后不久被学习并影响预测,但这种影响在预训练结束时会显著减弱。该研究使用了32个GPT-2模型,并测量了交叉熵、插值损失和权重位移,以分析学习和遗忘过程,得出结论认为此类注入会将模型重新定位在其训练盆地内,而不会从根本上改变其轨迹。

  4. TOOL · CL_206355 ·

    受量子启发的复杂状态可大幅减少LLM训练步数

    研究人员探索了一种训练序列模型的新方法,该方法利用受量子理论启发的复数值状态表示,而不是传统的实数值状态。这种“量子捷径”方法应用于Mamba和Transformer模型时,显著减少了达到目标验证损失所需的优化步数。具体而言,复数值模型以其对应实数值模型的约三分之一到二分之一的步数实现了这些结果,展示了加速大型语言模型训练的潜在途径。

  5. TOOL · CL_180498 ·

    DeltaFlow 推出噪声自适应网络以实现高效语言去噪

    研究人员开发了 DeltaFlow,这是一种新颖的噪声自适应双向门控 Delta 网络,专为高效的连续语言去噪而设计。这种新架构旨在克服嵌入式语言流中全非因果注意力相关的计算成本。DeltaFlow 提供两种变体,DeltaFlow-A 和 DeltaFlow-P,与现有基线相比,它们降低了困惑度并提高了吞吐量,证明了其作为语言去噪任务的有效替代方案的潜力。

  6. TOOL · CL_178345 ·

    新的基准测试显示,AI文本检测器难以处理改写后的人类内容

    一个名为ARB的新基准数据集已被开发出来,用于评估AI文本检测器在大型语言模型改写人类创作内容时的有效性。该数据集包括人类撰写的文本、直接的LLM生成文本,以及利用四种开源生成器改写的人类和LLM文本的版本。评估显示,与直接的LLM生成文本相比,检测器在LLM改写的人类文本上的表现明显更差,这表明了当前检测能力存在差距。

  7. TOOL · CL_190052 ·

    DeltaFlow 推出噪声自适应双向网络,实现高效语言去噪

    研究人员开发了 DeltaFlow,一种新颖的噪声自适应双向门控 Delta 网络 (GDN),旨在提高嵌入式语言流 (ELF) 的效率。与使用昂贵非因果注意力的传统 ELF 不同,DeltaFlow 提供了一种循环替代方案。引入了 DeltaFlow-A 和 DeltaFlow-P 两个变体,其中 DeltaFlow-P 在 OpenWebText 数据集上展示了困惑度降低和显著的吞吐量加速。

  8. RESEARCH · CL_169569 ·

    新研究解决了掩码扩散语言模型的评估和架构问题

    两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。

  9. RESEARCH · CL_160904 ·

    新研究探索离散流匹配和强化学习在生成模型中的应用

    两篇研究论文探讨了生成模型方面的进展,重点关注离散结构和基于流的模型。第一篇论文引入了上下文加权离散流匹配,通过考虑局部上下文来提高离散数据上的生成质量,在OpenWebText上将生成困惑度降低了高达63%。第二篇论文(已被撤回)提出了SuperFlow,一个使用强化学习的框架,用于提高文本到图像生成流模型的训练效率和性能,显示出训练时间的显著缩短和优于现有模型的性能。

  10. TOOL · CL_160858 ·

    Gumbel蒸馏提升并行文本生成质量

    研究人员开发了一种名为Gumbel蒸馏的新技术,以提高并行文本模型的生成质量。该方法利用Gumbel-Max技巧在潜在噪声空间和教师模型的输出token之间创建确定性连接。Gumbel蒸馏是模型无关的,可以与各种并行解码架构集成。在LM1B和OpenWebText数据集上的实验表明,与标准的MDLM训练相比,MAUVE分数显著提高了30.0%,生成困惑度降低了10.5%。

  11. TOOL · CL_141393 ·

    新的神经网络优化技术提高了训练速度

    研究人员开发了一种名为".method"的新型神经网络权重重参数化技术,旨在提高优化速度和损失下降。该方法结合了感知符号的对称指数路径和线性路径,创建了弯曲的参数空间几何。在OpenWebText上训练Transformer的实验表明,与标准的线性参数化相比,".method"在训练步数上减少了1.32–1.49倍,达到了相同的验证损失,并且模型宽度越大,收益越显著。

  12. TOOL · CL_121080 ·

    新的固定点流增强了语言模型的自条件能力

    研究人员引入了一种名为固定点流的新技术,用于连续流式语言模型,增强了自条件能力。该方法解决了自条件能力性能提升不明确的问题,并将其应用于少步生成器。该方法将固定点流构建为一个二维类别,其中一个维度处理流过程,另一个维度管理固定点迭代,从而能够将其蒸馏成一个名为 FMLM$^*$​ 的流图语言模型。据报道,该模型在 OpenWebText 数据集上的一步和少步生成任务上均优于当前最先进的模型。

  13. RESEARCH · CL_119621 ·

    新的NC-FFN架构增强了Transformer的可解释性和效率

    研究人员开发了一种新颖的、参数中性的Transformer前馈网络替代方案,称为NC-FFN,它利用显式的模糊集运算。这种新架构在N位奇偶校验任务上表现出强大的参数效率,并在OpenWebText等更大模型的困惑度上与GELU基线相匹配。NC-FFN还提高了语法许可和量词理解能力,使得前馈层的计算更加清晰和可解释。

  14. TOOL · CL_105167 ·

    新基准使用图随机游走来评估AI扩散采样器

    研究人员开发了一个新颖的框架,使用图上的随机游走来评估掩码扩散模型(MDMs)中的并行采样策略。这种方法允许对序列中的潜在结构进行定量分析,为研究采样器性能提供了一个可验证的沙盒。实验表明,现有的并行解掩方法并不普遍优于随机采样器,其性能在很大程度上取决于底层图结构。该研究还引入了一种新的二分采样器,在提高语言生成任务的速度-质量权衡方面显示出潜力。

  15. TOOL · CL_93350 ·

    新型混合架构提升长上下文语言模型效率

    研究人员引入了一种并行混合架构(PHA),它结合了门控状态空间(GSS)、分组查询注意力(GQA)和前馈网络(FFNs),以改进长上下文语言建模。该架构并行运行这些组件,允许每个组件专注于序列建模的不同方面,这与之前迫使SSM近似注意力或串行化这两种范例的方法不同。PHA在困惑度方面与标准Transformer具有竞争力,同时在吞吐量和内存使用方面提供了显著更高的效率,尤其是在长上下文方面。

  16. RESEARCH · CL_91397 ·

    全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展

    研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…

  17. RESEARCH · CL_82032 ·

    K-Forcing 通过一次解码多个 token 来加速 LLM 推理

    研究人员推出了一种名为 K-Forcing 的新范式,通过同时解码多个 token 来加速语言模型推理。这种推前方法将现有的自回归模型提炼成一个映射,该映射可以在一次通过中生成 k 个 token。K-Forcing 旨在提高高负载批量服务场景的效率,这是大规模 LLM 部署的关键领域。初步评估显示,在质量影响适中的情况下,速度提高了 2.4-3.5 倍。

  18. RESEARCH · CL_79120 ·

    新研究论文批评AI文本评估方法

    两篇新研究论文指出了当前评估AI生成文本方法的重大问题。一篇论文揭示了NLP会议上普遍存在的人工评估协议报告不足的问题,阻碍了可复现性和清晰度。第二篇论文批评了非自回归模型常用生成式困惑度的方法,认为它可以被“破解”以生成不连贯的文本,同时表现良好。两项研究都呼吁采用更健壮和透明的评估指标及方法。

  19. RESEARCH · CL_65985 ·

    BlockGen 模型探索使用混合采样器进行分块序列生成

    研究人员推出了一种新颖的分块序列建模方法 BlockGen,该方法利用混合采样器进行离散扩散。该方法比较了统一状态扩散模型 (USDMs) 与掩码扩散模型 (MDMs) 在分块生成序列(而非逐个 token 生成)时的有效性。BlockGen 将自回归 (AR) 预测与扩散模型相结合,以优化不太可能的 token,在 GSM8K 和 OpenWebText 等任务上表现出竞争力。

  20. RESEARCH · CL_62330 ·

    新的FP-MGMs大幅降低训练成本并提高生成质量

    研究人员开发了固定点掩码生成模型(FP-MGMs),以提高掩码生成模型的效率和质量。这个名为CoFRe的新框架利用固定点求解器和自适应深度来降低计算成本和参数使用量。CoFRe还结合了跨步一致性损失和三状态重用机制,以提高性能,尤其是在低采样预算下。该方法在文本和图像生成任务中显著减少了训练时间、VRAM和参数数量,同时提高了生成困惑度和图像质量。