一位开发者创建了一个自定义后端,允许 LFM 2.5 230M 模型在浏览器中运行,速度达到每秒 1400-1500 个 token,使用的是 RTX 3090 和 WebGPU。该系统设计为便携式,并支持 Nvidia 和 Apple Silicon 硬件,为每种硬件都进行了优化内核。这项技术正在被集成到 Sipp 库中。 AI
影响 实现了更易于访问和便携的本地 LLM 部署。
排序理由 用户开发的演示浏览器端 LLM 执行的工具。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →