研究人员正在开发创新方法,使大型语言模型 (LLM) 能够处理更大的上下文窗口,即使在消费级硬件上也是如此。一种名为 JustFit 的方法使用 KV 压缩和状态管理等技术,在具有 24 GiB RAM 的笔记本电脑上提供 200K 令牌 LLM,实现了超过先前基线 6 倍的上下文。另外,一个 44M 参数的量化 LLM 从头开始训练,模型大小为 19.8 MB,在 CPU 上速度约为 1,900 令牌/秒,展示了推理和状态保持转换的能力。另一个模型 MiniMax M3 提供了一个具有 1M 令牌上下文窗口的开源 LLM,成本低廉,可以直接处理整个代码库或大型文档。 AI
影响 使在消费级硬件上运行更大、更强大的 LLM 成为可能,从而可能使先进的 AI 功能民主化。
排序理由 该集群包含多篇研究论文和项目,详细介绍了用于改进 LLM 上下文窗口处理和效率的新颖技术和模型。
- Hugging Face
- MiniMaxAI
- MiniMax M3
- 1,900 tok/s
- 19.8 MB
- 1M context
- 44M parameter
- 45B tokens
- CPU
- SHADOW-50M
- JustFit
- M4 Pro MacBook
- mlx-vlm
- Qwen3.8-27B MXFP4
- ternary LLMs
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →