一个名为 Freetokens 的新项目已发布,旨在提高大型语言模型的效率。在配备 16GB VRAM 的 RTX 5080 上进行的早期测试,使用 QWEN3.6-35B-A3B NVFP4 模型,实现了大约每秒 100 个 token。该项目包括一篇研究论文和一个用于实现的 GitHub 存储库。 AI
影响 该项目可能导致更高效的本地 LLM 部署,从而可能降低用户的硬件要求。
排序理由 该集群讨论了一个新的项目发布,附有链接的论文和 GitHub 存储库,表明这是一项面向研究的公告。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →