一位开发者创建了一个自定义的量化大型语言模型(LLM),拥有2.5亿个参数,在300亿个token上进行了训练。该模型专为极致效率而设计,部署大小仅为60MB,且内存占用极少,使其能够在标准笔记本电脑CPU上以大约每秒400个token的速度运行,无需GPU。它具有独特的长上下文机制,可以将旧的token压缩到磁盘,从而能够访问多达1亿个token的历史记录,尽管其推理能力仅限于从这个扩展缓存中检索。 AI
影响 这项开发展示了LLM部署的极致效率,有可能在低资源硬件上实现更广泛的AI能力普及。
排序理由 该项目描述了一个具有新颖量化和部署技术的自定义LLM,符合研究类别。[lever_c_从研究降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →