blimp
PulseAugur coverage of blimp — every cluster mentioning blimp across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究解构语言模型的分词算法
研究人员引入了两种新的分词算法,BottomUpLL 和 TopDownComp,以解构语言模型分词器中优化目标和搜索程序的影响。通过创建一个 2x2 的设计空间,他们比较了自下而上和自上而下的方法与压缩和对数似然目标。他们的发现表明,搜索程序而不是目标是性能的主要驱动因素,自下而上的分词器通常能实现更低的每字节比特数。然而,在 BLiMP 任务上,设计选择与性能之间没有发现一致的关系。
-
Looped GPT-BERT模型在语言建模中用计算换参数
研究人员开发了一种名为 Looped GPT-BERT 的新型语言模型,该模型在语言和下游任务上取得了与现有模型相当的性能,同时使用的参数更少。这是通过采用深度参数共享和循环遍历来实现的,有效地用计算换参数。该模型在一个有限的英语语料库上进行了训练,并在 BabyLM 2026 Strict-small 设置下进行了评估,在 BLiMP 和 GLUE 等指标上显示出有希望的结果,尽管也注意到了由于循环设计可能在表示空间中存在局限性。
-
新基准 FreqBLiMP 测试大型语言模型对罕见词的鲁棒性
研究人员开发了 FreqBLiMP,这是一个旨在通过控制词汇频率来评估大型语言模型 (LLM) 鲁棒性的新基准。这是 BLiMP 基准的扩展,专门解决了现有评估中对词频的忽视问题,词频是自然语言使用中的一个重要因素。FreqBLiMP 在明确的 Zipf 频率模型下重新生成最小对范式,以测试在罕见词情况下语法偏好是否能保持。对各种 LLM 系列的初步评估表明,虽然降低词汇频率会持续降低句子可能性,但对整体对比准确率的影响仅为中等。然而…
-
研究发现:Transformer 模型使用“离轴”计算来处理概念
一项新的研究论文探讨了 Transformer 模型内部的工作机制,揭示了其中间状态并非随机噪声,而是计算概念的功能性组成部分。研究发现,一个 12 层模型分两个不同阶段处理信息:首先,写入一个“离轴”子空间,然后在过程后期将答案“带回轴上”。这种离轴计算对于将概念组合与词汇隔离开至关重要,对其进行操作会严重损害模型的处理信息能力,即使困惑度和其他基准测试不受影响。
-
克里斯托弗·诺兰的《奥德赛》以有限的放映场次挑战IMAX 70毫米的界限
克里斯托弗·诺兰的最新电影《奥德赛》已上映,其中很大一部分使用IMAX胶片摄影机拍摄,以填满稀有的1.43:1宽高比银幕。这项技术壮举得益于更安静的IMAX摄影机和一个隔音“罩”,允许在现场直接录制对白。然而,全球只有41家影院配备了以其预期的IMAX 70毫米格式放映该电影的设备,这引发了关于可及性和不同观影体验的讨论。
-
Transformer 因生成失败而难以处理“不可能”的语言
一篇新的研究论文探讨了为什么像 GPT-2 这样的 Transformer 语言模型难以处理人类可以习得的“不可能”语言。研究发现,虽然这些模型对语法敏感度有所体现,但在生成高质量、长句方面却表现出明显的不足。这表明,生成失败,而非语法不敏感,可能是这些模型无法处理这种非自然语言的主要原因。