PulseAugur
中
实时 15:58:21
实体 distilgpt2

distilgpt2

PulseAugur coverage of distilgpt2 — every cluster mentioning distilgpt2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_277203 ·

    新研究质疑语言模型注意力头消融的因果论断

    一篇新发表在arXiv上的研究论文,调查了语言模型中注意力头消融在推断组件功能因果关系方面的可靠性。该研究使用GPT-2 small和DistilGPT2,证明了“归零”注意力头的常用实现方法可能产生与修正后预投影消融几乎不相关的结果。研究强调,像二元准确率这样的评估指标可能会掩盖行为极端下的效应,而黄金令牌对数概率提供了更分级的度量。通过采用匹配对照和发现/保留集划分,该论文表明修正后的每头效应排名非常稳定,但任务特异性的证据仍然薄弱。

  2. RESEARCH · CL_180682 ·

    ChaosProbe 方法揭示了冻结 Transformer 模型中的结构

    研究人员开发了 ChaosProbe,一种分析冻结 Transformer 模型内部结构的新颖方法。该技术使用确定性神经混沌启发式变换来创建基于响应的输入嵌入空间指纹。概念验证研究表明,ChaosProbe 可以成功识别模型家族以及 GPT-2、DistilGPT2、BERT-base-uncased 和 RoBERTa-base 等模型之间的关系。

  3. RESEARCH · CL_88573 ·

    Google 的 AMS 工具在三个测试的 LLM 中发现关键安全缺陷

    Google Cloud 已开源 AMS(Activation Model Scanner),一个用于分析模型激活空间几何结构以验证安全训练的工具。与传统的行为测试不同,AMS 直接检查模型的权重是否存在安全对齐的证据。对三个开源模型(TinyLlama、distilgpt2 和 Qwen2.5-0.5B)的初步测试均得出“CRITICAL”评级,表明缺乏有效的安全训练或与安全基准存在显著偏差。