研究人员推出 Opt.Gear,这是一种针对设备端部署和实时推理进行了优化的新型基础模型。该模型采用混合架构,结合了卷积和局部-全局注意力机制,显著减少了 KV 缓存内存,与同等规模的模型相比,在 NPU 上的预填充和解码速度提高了 4.9 倍。Opt.Gear 在 2T 标记语料库的精选 0.5T 标记子集上进行了训练,具有高度的数据效率。该模型以开放权重和适用于各种平台的部署二进制文件形式发布,包括 ONNX、Qualcomm NPU 和 Apple ANE,便于在边缘应用中使用。此外,Opt.Gear-1M,一个微型语言模型 (TLM),能够在微控制器单元 (MCU) 上运行,并在 ARM Cortex-M7 CPU 上使用 W4A32 量化实现了 20 TPS。 AI
影响 实现了在边缘设备和 MCU 上更快、更节省内存的 AI 推理。
排序理由 详细介绍了一种具有新颖架构和性能声明的新型基础模型的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →