一位用户已成功在 NVIDIA Orin Nano Super 8GB 设备上运行 Ling-3.0-tiny 模型,实现了 128K 上下文窗口和 IQ4_NL 量化。该模型采用混合 KDA+MLA 推理 MoE 架构,能够容纳 8GB 统一内存,并展示了在其硬件类别中具有前景的性能。尽管在最大上下文长度下检索精度有所下降,但该设置被认为对于托管代理和处理简单任务是可行的。 AI
影响 展示了在低功耗边缘设备上运行具有大上下文窗口的高级 LLM 的可行性。
排序理由 用户成功在消费级硬件上运行特定模型,展示了其能力和局限性。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →