PulseAugur
实时 07:26:44
实体 TinyLlama-1.1B

TinyLlama-1.1B

PulseAugur coverage of TinyLlama-1.1B — every cluster mentioning TinyLlama-1.1B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 9
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_221262 ·

    新的自适应对数空间量化提高了LLM优化器的内存效率

    研究人员开发了一种名为自适应对数空间(AL)的新量化方法,以提高训练大型语言模型时使用的优化器的内存效率。该方法为每个块自适应量化范围,并保持精确零不变性,与现有的低精度技术相比,提供了更好的状态重构误差控制。在TinyLlama-1.1B和GPT-2等模型上的评估表明,在对困惑度或损失影响极小的情况下,优化器状态存储显著减少,这表明了一种更具拓扑感知的优化器量化方法。

  2. RESEARCH · CL_193307 ·

    新研究探索大型语言模型中的递归和隐式推理

    两篇新研究论文探讨了改进大型语言模型(LLMs)隐式推理的方法。第一篇论文介绍了“递归深度 Transformer”,它通过在相同的 Transformer 层上进行迭代计算来增强组合泛化能力。第二篇论文提出了“ReLIT”(递归隐式 Transformer),一个框架,通过添加一个可训练的递归块来增强一个固定的 LLM,在输出前优化潜在思维,旨在弥合符号推理与自然语言连贯性之间的差距。

  3. TOOL · CL_185357 ·

    PEFT方法为端侧小语言模型提供能耗高效的个性化方案

    一篇新的研究论文评估了用于在消费级GPU上个性化小语言模型(SLM)的各种参数高效微调(PEFT)方法。该研究比较了五种方法——全参数微调、LoRA、LoRA+、QLoRA和BitFit——在不同的SLM架构上,包括基于Transformer的模型(如TinyLlama-1.1B和Qwen3-1.7B)以及基于SSM的模型(如Mamba-1.4B和Mamba-2-1.3B)。结果表明,LoRA+通常是最能耗高效的方法,而QLoRA在减…

  4. TOOL · CL_167105 ·

    新的CausalGate框架通过剪枝模块提升Transformer效率

    研究人员开发了CausalGate,一个旨在提高Transformer推理效率的新框架。与依赖观察性启发式方法的前辈不同,CausalGate采用一种干预引导的方法来精确衡量丢弃单个Transformer模块的语义影响。然后,这种重要性层次结构被蒸馏成静态的、轻量级的门控,消除了运行时开销。在TinyLlama-1.1B、Qwen2.5-3B和Llama-3.1-8B等模型上的评估表明,CausalGate的性能优于现有的动态路由和层…

  5. TOOL · CL_155699 ·

    少年构建完全本地化的 AI 生态系统 CODA OS

    一位 17 岁的开发者创建了 CODA OS,这是一个全面的 AI 生态系统,旨在完全在本地硬件上运行,无需依赖云。该系统包括一个 3D 重建工具、一个名为 BHAASM Transformer 的自定义 2.2B 参数语言模型、一个名为 VIJAY 的语音助手,以及视频通话和消息传递功能。该项目的动机是开发者无力承担云 AI API 的费用,目前运行在一台配备 RTX 5070 GPU 和 Intel NPU 的笔记本电脑上。

  6. TOOL · CL_137495 ·

    新编程语言"machin"在笔记本CPU上运行1B LLM速度提升4倍

    一位开发者创建了一种名为"machin"的新编程语言,它通过C进行编译,专为AI代理设计。使用这种语言,他们成功地在笔记本CPU上以每秒20个token的速度运行了TinyLlama-1.1B模型,其性能是参考C实现的四倍。关键优化包括分组量化、向量宽度利用和专门的字节点积函数,所有这些都没有使用BLAS或llama.cpp等外部库。

  7. TOOL · CL_98080 ·

    语音感知的LLM说话人验证能力较弱,新方法提升性能

    研究人员开发了一种新的方法来评估和增强语音感知的大型语言模型(LLM)的说话人验证能力。初步基准测试显示,当前的语音感知LLM在说话人区分能力方面较弱,在VoxCeleb1数据集上的错误率超过20%。为解决此问题,引入了一种轻量级增强技术,该技术将说话人嵌入注入LLM并仅训练LoRA适配器。该方法在TinyLLaMA-1.1B上进行了演示,结果显示ECAPA-LLM在VoxCeleb1-E上的错误率为1.03%,接近专用说话人验证系统…

  8. RESEARCH · CL_97815 ·

    研究人员将Transformer注意力头转换为可执行的Python程序

    研究人员开发了一种新颖的方法,将Transformer语言模型中不透明的注意力机制转换为可执行的Python程序。该方法包括分析特定注意力头的注意力矩阵,然后提示预训练语言模型生成复制这些模式的代码。生成的程序可以用来替换神经网络注意力头,对模型性能的影响极小,从而促进神经网络的符号透明度。

  9. RESEARCH · CL_79592 ·

    AutoMegaKernel 将 Llama 模型编译为单个 CUDA 核函数

    研究人员开发了 AutoMegaKernel (AMK) 系统,该系统将 HuggingFace Llama 系列模型编译成单个、持久的 CUDA 核函数,以实现高效的前向传播。AMK 的静态验证器可确保调度安全,防止死锁和竞用条件。该系统支持从单一代码库支持多种 NVIDIA GPU 架构,并已展示出自我改进能力。

  10. RESEARCH · CL_68116 ·

    新的C++运行时加速了CPU上稀疏脉冲语言模型的推理

    研究人员开发了一种用于稀疏脉冲语言模型的C++推理运行时,显著提高了在商品化CPU上的性能。该新系统将稀疏二元脉冲状态视为基本单元,优化内存布局并使用INT8量化来实现更高的令牌解码速度。虽然与TinyLlama和Qwen2.5等现有模型相比,该系统展示了更高的吞吐量和更小的内存占用,但在WikiText-2基准测试中,感知尖峰的方法导致模型质量略有下降。

  11. RESEARCH · CL_29321 ·

    FibQuant 方法为 LLM 提供显著的 KV 缓存压缩

    研究人员开发了 FibQuant,一种新颖的向量量化方法,旨在显著压缩大型语言模型 (LLM) 中使用的键值 (KV) 缓存。该技术通过用更高效的基于向量的方法替换标量量化,旨在减少与长上下文推理相关的内存流量。实验表明,FibQuant 可以在保持高保真度的同时实现显著的压缩率,例如在 GPT-2 small KV 缓存上实现 34 倍压缩,并在 TinyLlama-1.1B 等模型上展示出比现有方法更高的困惑度。