实体
GPT-2 XL
GPT-2 XL
PulseAugur coverage of GPT-2 XL — every cluster mentioning GPT-2 XL across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新工具通过聚合随机生成来可视化隐藏的LLM偏见
研究人员开发了TreeTracer,一个旨在揭示大型语言模型(LLMs)中隐藏偏见的视觉分析工具。与检查单个输出或使用静态指标的传统方法不同,TreeTracer将数百个随机生成聚合到分层结构中。这使得对语义上下文进行更全面的比较,并有助于检测代表性危害,如代词压制和对话边缘化。对GPT-2 XL与Apertus模型进行比较的案例研究证明了TreeTracer在揭示这些偏见方面的有效性。
-
新方法通过分片蒸馏加速神经网络压缩
研究人员开发了一种名为分片特征蒸馏的新型神经网络压缩方法。该技术将大型模型分解为更小、可管理的切片,进行独立张量化,与传统的全局微调相比,可以加快优化速度并提高准确性恢复。该方法在 ResNet-34 和 GPT-2 XL 等模型上显示出有希望的结果,证明了其可扩展性和有效性,尤其是在分布式计算环境中。
-
LLM大脑对齐随训练数据和任务特异性而变化
研究人员正在探索大型语言模型(LLM)如何在不同语言和任务中与人类大脑活动对齐。研究表明,LLM的中间层最能预测大脑反应,并且这种对齐受训练数据语言主导地位的影响,而非模型本身的类型。此外,经过指令微调的多模态LLM表现出更强的大脑对齐能力,尤其是在围绕特定任务需求而非仅仅表面语义进行组织时。