PulseAugur
实时 12:01:41
English(EN) I developed my own quantized LLM from scratch, trained on 30B tokens, deploys in 60 MB [R]

开发者创建了用于CPU部署的高效量化LLM

一位开发者创建了一个自定义的量化大型语言模型(LLM),拥有2.5亿个参数,在300亿个token上进行了训练。该模型专为极致效率而设计,部署大小仅为60MB,且内存占用极少,使其能够在标准笔记本电脑CPU上以大约每秒400个token的速度运行,无需GPU。它具有独特的长上下文机制,可以将旧的token压缩到磁盘,从而能够访问多达1亿个token的历史记录,尽管其推理能力仅限于从这个扩展缓存中检索。 AI

影响 这项开发展示了LLM部署的极致效率,有可能在低资源硬件上实现更广泛的AI能力普及。

排序理由 该项目描述了一个具有新颖量化和部署技术的自定义LLM,符合研究类别。[lever_c_从研究降级:ic=1 ai=1.0]

在 r/MachineLearning 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

开发者创建了用于CPU部署的高效量化LLM

报道来源 [1]

  1. r/MachineLearning TIER_1 English(EN) · /u/Final-Data-1410 ·

    我从头开始开发了自己的量化LLM,在300亿个token上训练,部署大小为60MB [R]

    <!-- SC_OFF --><div class="md"><p>I trained a 250M parameter model from scratch on 30B tokens of fineweb. It’s quantized to under 2 bits so the whole deployment is 60 MB and it needs about 80 MB of RAM to run. Runs around 400 tok/s on a normal laptop CPU, no GPU needed.</p> <p>Ho…