一位开发者为 Gemma 2B 语言模型创建了一个高度优化的推理引擎,完全用 x86-64 汇编编写。该引擎拥有仅 5.2 KB 的最小二进制占用空间,并在四核 i5 CPU 上使用 FP16 精度实现了约 4.6 个 token/秒。该项目名为 PULSAR-ASM,旨在探索运行现代 Transformer 的裸机要求,并作为资源受限微控制器的参考,摒弃了 C/C++ 或 PyTorch 等传统运行时。 AI
影响 展示了 LLM 在资源受限硬件上的极端优化潜力。
排序理由 开发者为现有模型创建的最小占用空间优化。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →