PulseAugur
实时 04:27:07
实体 Pythia

Pythia

PulseAugur coverage of Pythia — every cluster mentioning Pythia across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 47
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 46
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 47 条
  1. TOOL · CL_206481 ·

    新的KAN方法解剖了Pythia-Herwig在物理事件生成中的差异

    研究人员开发了一种新的方法,使用加性Kolmogorov-Arnold网络(KANs)来分析高能物理事件生成器(如Pythia和Herwig)之间的差异。这种方法允许分阶段的功能分析,将差异分解到模拟的各个层面,从硬散射到强子化。研究发现,多重性的差异在淋浴层面很突出,而在强子化后,喷流质量和形状变得更加重要,在完整的生成器配置中出现混合结构。这个基于KAN的框架提供了生成器模型依赖性的详细功能解剖,揭示了持续的结构和支持失败。

  2. TOOL · CL_206383 ·

    新方法衡量神经网络训练动态中的可预测性

    研究人员开发了一种新方法来衡量神经网络训练动态中的结构化可预测性。该方法使用互补的探针族来分析时间冗余,识别在何时何种条件下,近期更新会影响未来参数的运动。研究发现,与特征变换权重相比,归一化和偏置等辅助参数表现出更简单的动态,而特征变换权重在局部、时变区域内表现出可预测的行为。该诊断工具应用于 CIFAR 上的视觉训练和 Pythia 预训练检查点,揭示了架构和训练方法如何影响所测量的结构。

  3. TOOL · CL_206351 ·

    新判据量化神经网络的深度充足性

    研究人员开发了一种一阶判据,用于确定残差神经网络是否已达到足够的深度。该判据基于残差非退化概念,证明只有当条件激活梯度投影到可容许的残差切线空间时,额外的深度才是有价值的。研究表明,激活梯度幅度可以作为跨越各种模型架构(包括 ResNets、GPT-2 和 Pythia 检查点)的残差深度的剩余经验价值的可靠诊断。此外,保持函数不变的增长实现了与从头开始训练相媲美的性能。

  4. TOOL · CL_205801 ·

    揭示语言模型知识蒸馏的新分布视图

    研究人员为语言模型的知识蒸馏(KD)引入了一种新的分布视角。该方法超越了对 token 分布的点对点比较,而是考虑了教师模型输出的多种温度视图。然后,学生模型针对这些视图的几何感知聚合进行训练,该聚合通过各种池化和聚合方法进行形式化,包括去偏的 Sinkhorn 散度。在指令微调模型上的实验表明,多温度聚合的收益取决于这些视图的离散度,而最优的 KD 损失函数则取决于教师模型和学生模型之间的性能差距。

  5. COMMENTARY · CL_204952 ·

    NVIDIA 押注开源 AI 模型以推动芯片需求

    NVIDIA 大力投资开源 AI 模型,旨在建立一个生态系统,让企业能够构建自己的 AI,而不是依赖于 Anthropic 和 OpenAI 等实体的闭源模型。这种策略被比作 Linux 的发展,开源软件最终成为一种可持续的力量。NVIDIA 的方法包括发布 Nemotron 等模型的训练数据和代码,目标是增加对其芯片的需求。这个开源模型生态系统的成功,取决于它能否产生与基于 API 的模型相媲美的利润,或者能否在 AI 繁荣的巨大规…

  6. TOOL · CL_198057 ·

    大型语言模型在冲突任务中表现出与人类认知相似的一致性效应

    研究人员开发了一种新颖的言语冲突任务,用于研究大型语言模型中的一致性效应,并与心理学和神经科学研究进行类比。该任务涉及引发默认完成的提示,其中明确的规则要么同意,要么与此默认规则相冲突。对 Gemma-2-2B 和各种 Pythia 版本的模型分析显示出强烈的默认倾向和显著的一致性效应,这归因于权重内默认映射与上下文内基于规则的映射之间的竞争。该研究利用了因果归因、注意力分析和消融来识别由表面线索或明确规则激活的不同处理路径。

  7. TOOL · CL_183310 ·

    Transformer模型转换:在不同尺寸模型间进行接线知识转移

    一篇新的研究论文探讨了不同尺寸Transformer模型之间的知识可转移性,特别关注Pythia系列中将一个14亿参数模型转换为一个4.1亿参数版本。研究发现,尽管表示形式高度一致,但由于结构差异,直接参数转换具有破坏性。该研究提出了一种结合最小二乘补偿和方差保持重缩放的方法,以有效地转移知识,在显著更少的token下达到与从头训练相当的性能,尤其是在较低预算下。论文还指出了在大规模转换时的局限性,并提出维度感知正则化作为潜在解决方案。

  8. TOOL · CL_180689 ·

    Transformer理论扩展至包含前馈网络

    研究人员开发了Transformer的扩展动力学理论,将前馈网络(FFN)纳入为局部转向场。该新理论表明,FFN的切向分量对于在残差方向空间中的移动至关重要,并且具有小换向器缺陷的层可以并行化。对GPT-2、Pythia、Mistral和Llama模型的实验表明,该扩展理论提高了单步角度预测的准确性,并且FFN的贡献在Llama 3-8B等后期模型中有所增加。干预实验证实,切向FFN分量对于维持模型质量和输出多样性至关重要。

  9. TOOL · CL_169669 ·

    新指标预测神经网络宽度缩放带来的性能提升

    研究人员引入了“有效对齐维度”来更好地理解神经网络宽度缩放如何影响模型在未见过数据上的性能。这一新指标量化了激活梯度的信噪几何,为失配概率提供了有限样本界限。使用 LLaMA 风格的 Transformer、Pythia 和 ResNet-20 模型进行的实验表明,更宽的网络通常具有更大的有效对齐维度,并且表现出更少的经验性失配,直接干预证实了该统计量对损失变化的预测能力。

  10. RESEARCH · CL_154406 ·

    稀疏自编码器为LLM数据和行为提供可解释的洞察 · 追踪4个来源

    研究人员正在探索使用稀疏自编码器(SAE)作为一种更具成本效益且可解释的方法来分析大规模文本语料库和理解大型语言模型的内部工作原理。这些SAE可以识别数据集之间的语义差异,揭示意想不到的概念相关性,并为基于属性的检索提供可控的嵌入。研究已将SAE应用于分析模型行为,例如比较Grok-4与其他前沿模型在歧义澄清能力上的差异,调查OpenAI模型行为随时间的变化,以及检查Whisper编码器的内部表示以揭示语言信息的层次结构。

  11. TOOL · CL_145841 ·

    大型语言模型的语言能力驱动大脑活动的左右预测不对称性

    研究人员发现,大型语言模型(LLMs)在预测人类大脑活动方面存在左右不对称性,这种不对称性随着模型正式语言能力的提升而出现。使用fMRI数据和OLMo-2-7B、Pythia等模型观察到的这种不对称性,与模型区分可接受和不可接受句子以及生成格式正确文本的能力相关。研究发现,大脑半球之间这种预测准确性的差异,与算术、Dyck语言任务或基于推理的文本任务的表现不符,表明其与语言处理存在特定联系。

  12. RESEARCH · CL_143633 ·

    Pythia系统自主提取临床症状,无需微调

    研究人员开发了Pythia,一个新颖的多智能体系统,用于从笔记中自主检测临床症状,无需微调。该系统独立优化提取提示,确保数据保留在本地基础设施上。Pythia表现强劲,平均敏感度为0.76,特异度为0.95,在特异度上优于精心策划的词汇表,在其他指标上与之相当或超越。与微调的BERT分类器相比,Pythia的敏感度显著更高,尤其是在不太常见的概念方面。

  13. TOOL · CL_141622 ·

    新理论表明红外组织控制着大型语言模型中的Transformer动力学

    一篇新论文提出,大型语言模型中的涌现行为是由一种涉及时间尺度态密度(TDOS)重组的物理机制所控制。研究人员使用Pythia语言模型从Transformer层雅可比矩阵中提取了弛豫谱,揭示了慢弛豫模式的渐进积累。这一过程导致了无标度记忆核和记忆自能的瞬时最大值,表明红外慢模组织是Transformer动力学中的一个普遍原理。

  14. TOOL · CL_133571 ·

    研究:位置编码方案塑造 Transformer 注意力头代数

    一篇新的研究论文探讨了 Transformer 模型中的位置编码方案如何影响注意力头的谱代数。研究发现,不同的位置编码方案,如旋转位置嵌入(RoPE)、学习绝对位置编码和 ALiBi,会导致注意力头产生不同的谱指纹。这些指纹并非预先设定的约束,而是在训练过程中动态产生的,反映了注意力头的功能作用。研究表明,位置编码方案的选择显著影响模型的学习过程和效率。

  15. RESEARCH · CL_131359 ·

    新方法降低嵌入式GPU上SLM微调的能耗

    研究人员开发了一种面向资源受限嵌入式设备的SLM(小型语言模型)微调的能效方法。该研究在GLUE基准测试上对BERT和Pythia变体进行了微调行为的表征,并提出了基于机器学习的模型选择,以优化GPU DVFS设置。在NVIDIA Jetson AGX Orin上的实验表明,与默认的MAXN模式0相比,平均能耗节省了13.11%,节省幅度高达26.73%。

  16. TOOL · CL_117773 ·

    新研究追踪Transformer语言模型中的心理化和情境建模能力

    一篇新研究论文探讨了Transformer语言模型(特别是Olmo2和Pythia系列)在情境建模和心理化能力方面的发展。研究发现,在错误信念任务(FBT)上的准确表现取决于模型大小和训练量,并且在预训练过程的后期出现。虽然训练后干预可以提高FBT的准确性,但模型仍然表现出脆弱性,易受非事实动词和其他代理的知识状态的影响。研究表明,更大、训练更充分的模型会发展出部分连贯的情境模型,但其心理化能力仍然容易受到特定语言线索的影响。

  17. RESEARCH · CL_109505 ·

    AI模型在中途训练中会忘记已学规则,研究发现

    一项新的研究论文介绍了“自然遗忘”(natural ungrokking)的概念,描述了语言模型如何在预训练期间学习一条规则,却在没有损失曲线变化的情况下随后将其遗忘。研究发现,已学规则的存续取决于它们在训练数据中出现的频率,而非数据与参数的比例。有趣的是,该研究还表明,虽然可以有意地破坏一条已学规则,但恢复它却是一个不对称的过程,即使在支持性数据显著增加的情况下也未观察到恢复。

  18. TOOL · CL_104774 ·

    无键注意力机制将KV缓存减半,提高Transformer效率

    研究人员推出了一种新颖的Transformer注意力机制——无键注意力(Keyless Attention),该机制完全消除了键投影,仅基于查询(queries)和值(values)进行操作。与标准注意力相比,这种方法产生了一个仅值缓存(Value-Only Cache),将KV缓存内存和访问开销减半,同时保持或提高了解码吞吐量。该机制还实现了深度注意力因子分解(Depth-m Attention Factorization),实验表…

  19. RESEARCH · CL_96198 ·

    新基准应对大型语言模型的隐私风险

    研究人员开发了新的方法来评估针对大型语言模型(LLM)的成员推理攻击(MIA),特别关注音频和文本模态。第一项研究引入了一种系统性的评估方法,用于大型音频语言模型(LALM),使用“多模态盲基线”来控制分布偏移,揭示了记忆是跨模态的,并且与说话人的声音身份有关。第二篇论文CheckMIABench提出了一种基于中间训练检查点和公共数据进行LLM原则性MIA评估的框架,展示了其在Pythia和OLMo模型上的应用,并发布了一个模块化库以…

  20. COMMENTARY · CL_91578 ·

    AI 透明度辩论:“开放权重”不足,需要数据和价值洞察

    文章《开放权重,封闭思想:AI 透明度究竟需要什么》认为,仅发布模型权重(一种被称为“开放权重”的做法)不足以实现真正的 AI 透明度。虽然这允许用户在不依赖企业云的情况下本地运行模型,但它模糊了关于训练数据、微调过程和嵌入价值观的关键细节。作者将此与 OLMo 和 Pythia 等真正开放的 AI 项目进行了对比,这些项目提供了对其训练数据和管道的完全可见性,并指出商业压力常常阻碍这种透明度。文章强调,像 Common Crawl …