Qwen2.5-7B-1M
PulseAugur coverage of Qwen2.5-7B-1M — every cluster mentioning Qwen2.5-7B-1M across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新技术提升 LLM 推理速度和效率 · 已追踪 10 个来源
研究人员正在开发多种新技术来加速大型语言模型 (LLM) 推理。Hugging Face 的 LFM2.5-DSpark 通过使用推测解码将速度提升高达 3.2 倍,而 Intel 正在探索使用流水线并行和推测解码在 AI PC 上进行分布式推理。其他方法包括用于混合精度注意力的 TileMix、用于超低比特推理的 FluxBin 以及优化请求分组的多箱批处理。此外,Pallas 旨在通过在蜂窝切换期间主动迁移 KV 缓存来改善 AI…
-
新方法将LLM KV缓存卸载到RAM,以实现长上下文和持久内存
一种新技术已被开发出来,用于解决本地大型语言模型在处理长上下文和跨重启保持状态时的内存限制。该方法涉及将模型存储计算出的内部状态的KV缓存从VRAM卸载到CPU RAM和磁盘。当需要时,使用VRAM中的一个小索引来检索相关的KV块,从而使模型能够访问长达800,000个token的上下文,同时保持VRAM使用量稳定。该系统还允许模型在进程重启后从其存储的状态恢复,有效地充当持久内存。
-
WSL2 vllm 在 6GB 显存中无法运行 Qwen2.5-7B-1M,Windows transformers 成功
一位开发者在尝试于配备 6GB 显存的消费级笔记本电脑上运行 Qwen2.5-7B-1M 模型时,遇到了意料之外的内存限制。虽然 Windows 的 "transformers" 库可以通过溢出到系统内存来处理 4k 上下文,但使用 "vllm" 的 WSL2 环境却无法加载模型,这表明是 Windows 操作系统的内存管理促成了这一点,而不是推理引擎本身。开发者还发现,GitHub Models 等平台上的免费套餐在模型可用性和上下…