PulseAugur
实时 02:02:13
实体 TinyStories

TinyStories

PulseAugur coverage of TinyStories — every cluster mentioning TinyStories across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. RESEARCH · CL_163476 ·

    使用受 Gemma 启发的技巧,2890 万参数的大语言模型在 8 美元的微控制器上运行

    一个拥有 2890 万参数的语言模型已成功在售价 8 美元的 ESP32-S3 微控制器上运行,速度约为每秒 9 个 token。这一重大进展得益于借鉴了 Google Gemma 模型中的逐层嵌入(Per-Layer Embeddings)概念,使得模型的大部分参数可以驻留在速度较慢的闪存中,而不是快速的 RAM 中。该模型在 TinyStories 数据集上进行了训练,能够生成简短连贯的故事,但由于其推理核心的限制,缺乏指令遵循或…

  2. TOOL · CL_143816 ·

    新的 SV-Attention 为 AI 模型提供认证选择和精确遗忘功能

    研究人员推出了一种新颖的 AI 模型记忆机制——支持向量注意力(SV-Attention),该机制利用了源自支持向量机的最大间隔方法。这种方法允许对 token 进行认证选择和精确遗忘,这意味着可以从模型的记忆中精确移除特定数据点,而不会影响其他输出。实验表明,与标准注意力机制相比,SV-Attention 在真实数据流上实现了更高的召回率和更好的性能,同时还展示了手术式遗忘和病人记录删除等能力。

  3. TOOL · CL_128607 ·

    新理论从语言统计预测神经缩放定律

    研究人员开发了一种新理论,可以定量预测在自然语言数据集上训练的大型语言模型(尤其是在数据受限的情况下)的神经缩放定律的指数。该理论确定了语言的两个关键统计特性:成对标记相关性的衰减和下一标记条件熵随上下文长度的衰减。推导出的公式没有自由参数,可以根据这些语言统计数据准确预测缩放指数,并已在 TinyStories 和 WikiText 基准上训练的 GPT-2 和 LLaMA 等模型上得到验证。

  4. TOOL · CL_117499 ·

    AI Training Manager 为机器学习提供自适应控制

    研究人员开发了一个 AI Training Manager,一个旨在实时监督和调整机器学习训练过程的系统。该管理器充当监督控制器,审计遥测数据并对学习率和正则化强度等参数进行验证更新。它在语言建模任务中纠正过拟合方面表现出有效性,实现了显著更低的验证损失,并在机器人操作的强化学习中缓解了探索问题。

  5. RESEARCH · CL_109002 ·

    新方法将Transformer的位置编码适配到图数据

    研究人员正在探索将旋转位置编码(RoPE)——一种广泛用于Transformer大语言模型和视觉Transformer的技术——应用于图结构数据。一种称为波诱导旋转编码(WIRE)的方法,应用图拉普拉斯算子的谱信息来旋转token,从而提高图学习任务的性能。另一项开发,高维动态旋转位置嵌入(HDD-RoPE),提出了一种多维位置嵌入方法,允许数据依赖的旋转并加速在TinyStories等数据集上的收敛。

  6. RESEARCH · CL_97815 ·

    研究人员将Transformer注意力头转换为可执行的Python程序

    研究人员开发了一种新颖的方法,将Transformer语言模型中不透明的注意力机制转换为可执行的Python程序。该方法包括分析特定注意力头的注意力矩阵,然后提示预训练语言模型生成复制这些模式的代码。生成的程序可以用来替换神经网络注意力头,对模型性能的影响极小,从而促进神经网络的符号透明度。

  7. RESEARCH · CL_86627 ·

    研究揭示小型 Llama 风格模型的训练动态

    一项针对在固定、计算受限的代币预算下训练的小型 Llama 风格语言模型的研究表明,仅凭最终性能不足以评估效率。该研究采用定量实验设计,分析了跨代币间隔的训练动态,观察到对验证损失、困惑度和波动性有显著影响。轨迹显示初始阶段快速改进,随后出现退化,在最终检查点时验证损失增加,这表明在计算受限的情况下,更多的代币可能不会带来成比例的收益,并且会掩盖不稳定性。

  8. TOOL · CL_77255 ·

    WAV v1 通过多分辨率残差路由增强Transformer训练

    研究人员推出了一种新颖的方法WAV v1,用于改进深度仅解码器Transformer的训练。该技术通过引入多分辨率细节基来增强残差路由,这些细节基捕获了关于注意力(attention)和MLP更新的方向信息,以及早期与晚期子层动力学。WAV v1在TinyStories和Text8等语言建模任务中表现出显著优势,尤其是在24层和48层等更深的层级中,以最小的参数开销超越了现有方法。

  9. TOOL · CL_60268 ·

    业余爱好者用 8GB 显存从零开始训练小型大型语言模型

    一位 Reddit 用户仅使用 8GB 显存就成功地从零开始训练了一个小型语言模型。该项目可在 GitHub 上找到,专注于 TinyStories 数据集,并探索了各种训练技术。虽然生成的模型只有 2500 万个参数,但用户对在有限的硬件上实现这一壮举表示满意。

  10. TOOL · CL_55150 ·

    微型 LLM 在旧 RTOS 内的模拟 90 年代 CPU 上运行

    一位开发者成功地在一个模拟的 1990 年代 CPU 环境中运行了一个拥有 26 万参数、在 TinyStories 数据集上训练的 LLM。该设置运行在一个已有 18 年历史的实时操作系统 (RTOS) 上,该系统是开发者使用 Claude 和 Qwen 等 AI 工具复活的。为了在缺乏浮点运算单元的模拟 ColdFire MCF5307 处理器上实现这一壮举,模型被量化为 INT8,并采用了 Carmack 的快速平方根倒数等技术…