PulseAugur
实时 09:23:18
English(EN) Opt.Gear Technical Report

Opt.Gear 模型为设备端 AI 提供 4.9 倍的推理速度提升

研究人员推出 Opt.Gear,这是一种针对设备端部署和实时推理进行了优化的新型基础模型。该模型采用混合架构,结合了卷积和局部-全局注意力机制,显著减少了 KV 缓存内存,与同等规模的模型相比,在 NPU 上的预填充和解码速度提高了 4.9 倍。Opt.Gear 在 2T 标记语料库的精选 0.5T 标记子集上进行了训练,具有高度的数据效率。该模型以开放权重和适用于各种平台的部署二进制文件形式发布,包括 ONNXQualcomm NPUApple ANE,便于在边缘应用中使用。此外,Opt.Gear-1M,一个微型语言模型 (TLM),能够在微控制器单元 (MCU) 上运行,并在 ARM Cortex-M7 CPU 上使用 W4A32 量化实现了 20 TPS。 AI

影响 实现了在边缘设备和 MCU 上更快、更节省内存的 AI 推理。

排序理由 详细介绍了一种具有新颖架构和性能声明的新型基础模型的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Opt.Gear 模型为设备端 AI 提供 4.9 倍的推理速度提升

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Juneyoung Park, Youngwook Kwon ·

    Opt.Gear Technical Report

    arXiv:2608.01034v1 Announce Type: new Abstract: We introduce Opt.Gear, a foundation model designed for efficient on-device deployment, real-tim inference, and strong task capability. It includes a dense model (1M, 270M, and 1B) with a context length of 64K. We designed a new hybr…