LemonSeed Studio 是一个基于 iPad 的编辑器和 IDE,展示了使用 AMD GPU 的设备端推理能力。该系统在 R9700 GPU 上使用 Qwen3.8-27B 模型实现了每秒 159 个 token 的速度,在 Strix Halo GPU 上实现了每秒 64 个 token 的速度。该引擎 LSE 通过融合操作并为各种 GPU 生成自定义内核来优化模型性能,支持投机解码等功能以实现更快的推理。 AI
影响 展示了在消费级硬件上 LLM 的设备端推理能力的提升,可能为更强大的移动 AI 应用提供支持。
排序理由 这是特定软件工具在特定模型和硬件上的能力演示,而不是新的模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →