PulseAugur
中
实时 15:53:37
实体 Tiny Transformers

Tiny Transformers

PulseAugur coverage of Tiny Transformers — every cluster mentioning Tiny Transformers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_286905 ·

    小型Transformer通过新的训练方法实现更高的算术准确性

    研究人员开发了一种方法,通过使用算法草稿板和分层课程来提高小型语言模型的算术推理能力。他们发现,正确的数据加载和语言预训练至关重要,而像RoPE和SwiGLU这样的现代架构组件可以提高性能。特定的逐位长除法草稿板显著提高了准确性,但由于加法复杂性,多位数乘法仍然具有挑战性。该研究还强调了在无缓冲训练期间未见操作数和灾难性遗忘的问题。

  2. TOOL · CL_185300 ·

    小型Transformer模型通过“Protoreasoning”在AI分析中展现潜力

    研究人员已证明,小型Transformer模型可以利用一种称为“Protoreasoning”的逐步推理形式。该技术允许对大约一百万参数的模型进行详细的实验和推理过程分析,这比处理大型、计算密集型模型更可行。通过将Protoreasoning应用于涉及Dyck语言(嵌套括号)的任务,研究发现这些推理痕迹显著缩小了分布外数据的泛化差距。消融研究证实,推理痕迹的内容,而不仅仅是其存在,对于这种改进至关重要。

  3. RESEARCH · CL_128472 ·

    小规模Transformer模型:输入路径对少样本学习至关重要,对零样本学习则不然

    一项发表在arXiv上的新研究调查了不同的输入路径如何影响小型Transformer模型的绑定能力。研究发现,尽管零样本组合性能受归纳偏倚而非信息获取的限制,但少样本绑定效率受到参数共享和代码可读性的影响。研究还识别了不同输入路径的独特故障模式,其中符号路径在读出时丢失答案,索引路径则错误地绑定信息。