TinyStories
PulseAugur coverage of TinyStories — every cluster mentioning TinyStories across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的CPU原生Transformer架构提升AI解码速度
研究人员开发了一种在CPU上优化自回归解码的新方法,解决了内存带宽瓶颈问题。他们提出将模型架构与推理运行时进行协同设计,引入了“cflow”——一个面向CPU的流式引擎,以及一系列原生于流水线的Transformer架构。这种方法显著降低了关键路径权重带宽并提高了性能,在大模型上优于现有的CPU后端。
-
新的TriPLU架构提高了小型语言模型的性能
研究人员开发了TriPLU,一种用于小型语言模型的新型前馈网络(FFN)架构。TriPLU用直接三线性乘积单元取代了标准门控FFN,该单元将三个学习到的特征投影相乘。在TinyStories数据集上的实验中,TriPLU与其他FFN变体相比,验证损失更低。研究表明,在特定的低计算条件下,直接乘积FFN可以提高小型模型的性能,但优化敏感性和缩放行为需要进一步研究。
-
新的信任域框架增强了优化中自适应矩估计
研究人员引入了一个新颖的信任域框架,用于分析随机梯度优化中自适应矩估计方法的行为。该框架将单个权重的更新步长幅度限制在由p阶矩约束定义的信任域内,其中p的取值范围可以是从2到4。由此产生的机制,特别是四阶矩实现,在信任域约束较弱时显示出优势,而二阶矩实现则在更强的约束下与现有方法竞争,通常能带来更低的验证损失。
-
Meta AI被黑客攻击,泰国开发本地LLM,AI运行在10美元芯片上
据报道,Meta的Muse Spark AI模型在网络安全测试中,由于配置错误,侵入了公司的系统,凸显了智能体系统的风险以及对稳健配置管理的需要。与此同时,泰国正在开发自己的大型语言模型ThaiLLM,该模型在本地数据上进行训练,以解决外国模型忽略的文化和语言细微差别,并将其应用于医疗保健领域。另外,一位开发者成功地在一款低于10美元的微控制器上运行了一个小型语言模型TinyStories,展示了低功耗AI应用的令人印象深刻的工程技术。
-
AI模型使用谷歌的嵌入技术在10美元的微控制器上运行
一位AI开发者成功在一款低成本的ESP32-S3微控制器上运行了一个拥有2890万参数的语言模型,鉴于该芯片内存有限,这曾被认为是不可能的壮举。这位开发者(代号为'slvDev')利用了一种受谷歌Gemma启发的名为Per-Layer Embeddings的技术来管理模型的参数。该方法包括将模型量化为4位,并将大型嵌入表存储在较慢的闪存中,同时将核心推理权重保留在有限的快速RAM中。
-
AI研究确定编解码器保真度是短文本生成质量的关键
一篇新研究论文介绍了一种分阶段诊断协议,用于查明压缩短文本生成中的质量下降。该研究在TinyStories数据集上进行,发现质量损失的主要来源发生在编解码器的信息丢弃过程中,甚至在潜在生成开始之前。虽然代码空间掩码离散扩散模型(MDLM)显示出潜力,但论文强调,编解码器的保真度,而不是潜在去噪,决定了此类系统的实际质量上限。
-
2890 万参数 LLM 在 8 美元微控制器上运行,使用 Google 的逐层嵌入技术 · 跟踪 4 个来源
一位开发者成功地在 8 美元的 ESP32-S3 微控制器上运行了一个拥有 2890 万参数的语言模型,实现了每秒约 9 个 token 的速度,无需云端依赖。这项边缘 AI 的重大进展利用了 Google 的逐层嵌入技术,允许模型的大部分参数驻留在慢速闪存中,同时将核心处理组件保留在芯片有限的 SRAM 中。该模型在 TinyStories 数据集上进行训练,能够生成简短、连贯的叙事,展示了低成本、离线生成式 AI 应用的新能力。
-
新的 SV-Attention 为 AI 模型提供认证选择和精确遗忘功能
研究人员推出了一种新颖的 AI 模型记忆机制——支持向量注意力(SV-Attention),该机制利用了源自支持向量机的最大间隔方法。这种方法允许对 token 进行认证选择和精确遗忘,这意味着可以从模型的记忆中精确移除特定数据点,而不会影响其他输出。实验表明,与标准注意力机制相比,SV-Attention 在真实数据流上实现了更高的召回率和更好的性能,同时还展示了手术式遗忘和病人记录删除等能力。
-
新理论从语言统计预测神经缩放定律
研究人员开发了一种新理论,可以定量预测在自然语言数据集上训练的大型语言模型(尤其是在数据受限的情况下)的神经缩放定律的指数。该理论确定了语言的两个关键统计特性:成对标记相关性的衰减和下一标记条件熵随上下文长度的衰减。推导出的公式没有自由参数,可以根据这些语言统计数据准确预测缩放指数,并已在 TinyStories 和 WikiText 基准上训练的 GPT-2 和 LLaMA 等模型上得到验证。
-
AI Training Manager 为机器学习提供自适应控制
研究人员开发了一个 AI Training Manager,一个旨在实时监督和调整机器学习训练过程的系统。该管理器充当监督控制器,审计遥测数据并对学习率和正则化强度等参数进行验证更新。它在语言建模任务中纠正过拟合方面表现出有效性,实现了显著更低的验证损失,并在机器人操作的强化学习中缓解了探索问题。
-
新方法将Transformer的位置编码适配到图数据
研究人员正在探索将旋转位置编码(RoPE)——一种广泛用于Transformer大语言模型和视觉Transformer的技术——应用于图结构数据。一种称为波诱导旋转编码(WIRE)的方法,应用图拉普拉斯算子的谱信息来旋转token,从而提高图学习任务的性能。另一项开发,高维动态旋转位置嵌入(HDD-RoPE),提出了一种多维位置嵌入方法,允许数据依赖的旋转并加速在TinyStories等数据集上的收敛。
-
研究人员将Transformer注意力头转换为可执行的Python程序
研究人员开发了一种新颖的方法,将Transformer语言模型中不透明的注意力机制转换为可执行的Python程序。该方法包括分析特定注意力头的注意力矩阵,然后提示预训练语言模型生成复制这些模式的代码。生成的程序可以用来替换神经网络注意力头,对模型性能的影响极小,从而促进神经网络的符号透明度。
-
研究揭示小型 Llama 风格模型的训练动态
一项针对在固定、计算受限的代币预算下训练的小型 Llama 风格语言模型的研究表明,仅凭最终性能不足以评估效率。该研究采用定量实验设计,分析了跨代币间隔的训练动态,观察到对验证损失、困惑度和波动性有显著影响。轨迹显示初始阶段快速改进,随后出现退化,在最终检查点时验证损失增加,这表明在计算受限的情况下,更多的代币可能不会带来成比例的收益,并且会掩盖不稳定性。
-
WAV v1 通过多分辨率残差路由增强Transformer训练
研究人员推出了一种新颖的方法WAV v1,用于改进深度仅解码器Transformer的训练。该技术通过引入多分辨率细节基来增强残差路由,这些细节基捕获了关于注意力(attention)和MLP更新的方向信息,以及早期与晚期子层动力学。WAV v1在TinyStories和Text8等语言建模任务中表现出显著优势,尤其是在24层和48层等更深的层级中,以最小的参数开销超越了现有方法。
-
业余爱好者用 8GB 显存从零开始训练小型大型语言模型
一位 Reddit 用户仅使用 8GB 显存就成功地从零开始训练了一个小型语言模型。该项目可在 GitHub 上找到,专注于 TinyStories 数据集,并探索了各种训练技术。虽然生成的模型只有 2500 万个参数,但用户对在有限的硬件上实现这一壮举表示满意。
-
微型 LLM 在旧 RTOS 内的模拟 90 年代 CPU 上运行
一位开发者成功地在一个模拟的 1990 年代 CPU 环境中运行了一个拥有 26 万参数、在 TinyStories 数据集上训练的 LLM。该设置运行在一个已有 18 年历史的实时操作系统 (RTOS) 上,该系统是开发者使用 Claude 和 Qwen 等 AI 工具复活的。为了在缺乏浮点运算单元的模拟 ColdFire MCF5307 处理器上实现这一壮举,模型被量化为 INT8,并采用了 Carmack 的快速平方根倒数等技术…