PulseAugur
中
实时 17:54:49
实体 DistilGPT-2

DistilGPT-2

PulseAugur coverage of DistilGPT-2 — every cluster mentioning DistilGPT-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_277282 ·

    随机舍入可改善低精度Transformer推理

    研究人员调查了在低精度Transformer推理中使用随机舍入(SR)与就近舍入(RN)的对比,发现最佳方法取决于模型中的特定层。他们开发了一种可变精度随机舍入(VPSR)算法,以便在任意精度下进行实验。他们的分析显示,SR的误差包络比RN增长得慢,尤其是在多层感知机(MLP)中,而RN更适合语言模型头。通过将SR策略性地应用于MLP,将RN应用于头部,他们在DistilGPT-2上实现了接近全精度的困惑度。

  2. RESEARCH · CL_82020 ·

    AI模型权重显示局部线性结构演变

    研究人员调查了神经网络权重和激活中线性结构 Nature,发现虽然存在局部低秩结构,但它们并非稳态。这项在 DistilGPT-2 和 Qwen-0.5B 等合成 Transformer 和 LLM 上进行的研究表明,有用的基在短时间训练期间会显著漂移。然而,初始恢复更新可以捕获大部分位移,表明是局部几何形状的演变,而非全局任务方向。

  3. TOOL · CL_79846 ·

    模型多样性可防御边缘设备上的小型语言模型攻击

    研究人员开发了一种名为“模型多样性”的新型防御系统,用于检测边缘设备上小型语言模型训练过程中的对抗性攻击。该方法涉及同时训练多个语言模型,每个模型使用不同的边缘节点子集。通过监控这些模型之间的差异,系统可以识别并隔离试图污染训练数据的受损节点。评估表明,在分布式学习环境中,该方法比传统的单一模型防御更能有效地检测此类攻击。