PulseAugur
中
实时 05:13:33
实体 VRAM

VRAM

PulseAugur coverage of VRAM — every cluster mentioning VRAM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
55
90 天内 55
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/4 页 · 共 66 条
  1. TOOL · CL_284178 ·

    RTX 5090 显存压力导致本地 LLM 速度下降

    一位用户在使用本地大语言模型时遇到了显著的性能下降,token 生成速度从每秒 77 个下降到 7 个。这种速度下降发生在视频通话期间,视频通话似乎占用了 GPU 的显存,将其推向了极限。尽管性能有所下降,vLLM 服务进程并未报告任何错误或内存不足的情况。通过重启 vLLM 进程解决了该问题,这表明问题出在服务进程的内存状态,而不是模型或提示本身。

  2. TOOL · CL_282378 ·

    LLM VRAM 指南:8GB 至 80GB GPU 能运行哪些模型

    本指南详细介绍了在常见 GPU 大小上运行各种大型语言模型 (LLM) 的 VRAM 要求,重点关注 4 位量化和合理的上下文长度。它详细说明了哪些模型适用于 8GB、16GB、24GB、48GB 和 80GB VRAM 配置,并指出量化和上下文长度等因素会显著影响内存使用。细分显示,8GB 可运行 7B-9B 模型,16GB 适用于 13B-14B 模型,24GB 可容纳 30B 级模型(尤其是 MoE 架构),48GB 是运行 7…

  3. COMMENTARY · CL_277897 ·

    AI 和游戏 GPU 指南强调显存重要性与未来算力

    两份最新指南探讨了 AI 开发和游戏硬件的格局。一份指南强调了 GPU 显存对于 AI/ML 任务的关键作用,认为其重要性超过了原始处理能力。另一份指南则专注于高刷新率 1080p 游戏的最佳 GPU。相关讨论还对当前产品之外的 GPU 未来 AI 算力进行了展望。

  4. TOOL · CL_261826 ·

    开源 Flyweight 引擎支持在单 GPU 上使用系统 RAM 运行大型 MoE 模型

    Flyweight 是一个开源的 C++/CUDA 引擎,已在 PyPI 上发布,旨在通过利用系统 RAM 来运行超出单个 GPU VRAM 容量的混合专家(MoE)模型。该引擎支持 Qwen、DeepSeek-V4 和 Gemma 等多种模型,并提供 OpenAI/Anthropic 兼容 API 和聊天 UI 等功能。开发者正在寻找贡献者来扩展硬件支持,特别是 AMD 和 macOS 系统,并优化 CPU expert kernels。

  5. TOOL · CL_256792 ·

    如果接受率过低,推测性解码会拖慢大语言模型的速度

    推测性解码是一种旨在加速大语言模型推理的技术,但如果配置不当,它会适得其反地降低性能。该方法涉及一个较小的“草稿”模型生成候选 token,然后由较大的“目标”模型进行验证。只有当接受率——目标模型接受的草稿 token 的比例——足够高以抵消草稿模型的计算成本时,这种方法才有效。在一用户的经验中,由于接受率低,一个 32B 的模型速度变慢了 47%,这凸显了根据不同工作负载衡量此接受率并优化草稿长度和模型匹配的重要性。

  6. TOOL · CL_252643 ·

    本地 LLM 爱好者寻求高显存 GPU 推荐

    一位 Reddit 用户正在寻求适合本地运行大型语言模型的、显存容量大的 GPU 推荐,目标是取代其 ChatGPT Plus 订阅。该用户之前的 RTX 4090 Ti 损坏了,现在只剩下一块 3070。他们还怀疑 AI 公司人为抬高价格以阻碍开源开发。该用户正在考虑在他们的 MSI MAG X670E Tomahawk WiFi 主板上设置多 GPU,并明确排除了 Mac,以便于家庭实验室集成。

  7. COMMENTARY · CL_242329 ·

    旧硬件上的大型语言模型推理揭示了不断演变的真相

    作者详细介绍了在旧硬件上运行大型语言模型推理的经验,并将其与科学理解的不断演变进行了类比。起初,他们对最佳配置持有几种假设,例如禁用 Flash Attention 或强制使用特定内核,但这些假设后来被实际应用和硬件限制所推翻。学到的关键经验包括通过受控实验、阅读源代码以及随着时间的推移观察生产证据来验证主张的重要性,而不是仅仅依赖社区的主张或临时测量。这种专注于理解底层机制而非仅仅关注结果的严谨方法,被认为是性能工程的真正产物。

  8. TOOL · CL_242330 ·

    FreeToken 引擎可在个人 PC 上运行大型 MoE 模型

    FreeToken 是一个开源引擎,旨在通过将整个 PC 作为异构推理系统来在个人硬件上运行大型混合专家(MoE)模型。它通过将完整的专家池存储在 CPU 主机 RAM 中,同时将非专家权重和共享专家缓存保留在 GPU 中来管理 MoE 模型。该系统动态测量主机内存和 PCIe 带宽,以优化 CPU 和 GPU 之间的专家执行,并采用双缓冲来隐藏预填充期间的传输延迟。此外,FreeToken 还为代理工作负载提供语义感知缓存,允许它在…

  9. MEME · CL_237927 ·

    本地AI用户寻求文档管理VRAM指导

    一位Reddit r/LocalLLaMA板块的用户正在就本地AI设置的最佳VRAM寻求建议,特别是使用paperless-ai等工具进行文档管理任务。他们正在考虑8-12 GB VRAM范围内的GPU,并希望在不为可能超出需求的硬件过度消费的情况下,确保良好的用户体验。

  10. TOOL · CL_237486 ·

    本地 LLM 显存需求:量化是消费级硬件的关键

    在本地运行大型语言模型需要仔细考虑显存,量化是使模型能够适应消费级硬件的关键。所需的显存量主要取决于模型的参数数量及其量化级别,而不是模型名称。例如,一个 7B 参数的模型在全精度下通常需要约 14GB 显存,但通过 Q4_K_M 量化可以减少到约 4-5GB,使其可以在 8GB 显卡上运行。更高的显存,如 16GB 或 24GB,可以支持更大的模型或不那么激进的量化,从而提高代码编写和复杂推理等任务的性能和能力。

  11. TOOL · CL_237327 ·

    Comfy 用户寻求限制 Stable Diffusion VRAM 使用量的解决方案

    Stable Diffusion 工具 Comfy 的用户遇到了其消耗过多 VRAM 的问题,这与浏览器使用冲突并阻止了生成。通过命令行参数(如 `--disable-pinned-memory`、`--reserve-vram` 和 `--vram-headroom`)限制 Comfy VRAM 使用量的尝试已被证明无效或未记录。社区正在寻求解决方案,以将 Comfy 的 VRAM 分配限制在特定百分比。

  12. TOOL · CL_233733 ·

    Leafcloud 推出 AI 模型 VRAM 适配计算器

    Leafcloud 开发了一个 VRAM 适配计算器,帮助用户确定他们的 AI 模型是否能在特定硬件限制(如 24GB VRAM)内运行。该计算器考虑了模型大小以外的因素,包括精度、上下文长度、KV 缓存和服务开销。为鼓励采用,Leafcloud 为新用户提供每月 50 小时的免费 GPU 使用时间,在其基础设施的专用 24GB 分片上。

  13. TOOL · CL_229782 ·

    87GB LLM 通过量化在 CPU 上运行;vecq 工具针对设备端嵌入

    最近的一项基准测试表明,Qwen3.8-Flash-Next 大型语言模型(文件大小为 87.2 GiB)可以使用 llama.cpp 框架在 CPU 上以 8.34 tokens per second 的速度运行。这种性能是通过 4 位量化实现的,它显著减小了模型的大小。基准测试还显示,在 245K 的上下文长度下,96GB VRAM 相对于 24GB 的性能优势会减弱,并且将模型的嵌入表放在 GPU 上会极大地提高解码速度。为了解…

  14. COMMENTARY · CL_226993 ·

    LLM 请求分为计算密集型的预填充和受 VRAM 限制的解码阶段

    LLM 请求分两个不同的阶段进行处理,每个阶段都有自己的瓶颈。第一个阶段是“预填充”,模型同时处理整个用户提示,这个阶段计算密集,受 GPU 核心限制。此阶段会生成初始 token 和一个 KV 缓存,即保存在 VRAM 中的一组工作笔记。第二个阶段是“解码”,逐字生成答案的其余部分。在此阶段,瓶颈转移到 VRAM 和数据传输,因为必须为生成的每个单词读取整个模型权重,导致 GPU 核心基本未被充分利用。

  15. COMMENTARY · CL_225355 ·

    用户就高内存、有限显存的本地LLM编码寻求建议

    一位Reddit用户正在就最佳本地大型语言模型用于代理编码任务寻求建议,并给出了特定的硬件限制。他们拥有一台工作站,拥有大量内存(256GB)但显存有限,分布在两块GPU上(12GB和20GB)。用户正在考虑使用llama.cpp,并在一个适合显存的量化版Qwen 3.8 27B模型或一个利用高内存的更大模型之间进行权衡。他们还在询问在8小时工作日内,他们的硬件在生成有用输出方面的实际效用。

  16. TOOL · CL_224946 ·

    卸载“热”专家可将MoE模型性能提高50%

    r/LocalLLaMA上的一位用户开发了一种方法来提高无法完全放入VRAM的混合专家(MoE)模型的性能。通过仅将“热”专家卸载到GPU,而不是整个层,Qwen 3.8 Flash Next模型的性能提高了50%,每秒处理的token数从20个提高到30个。当整个模型超过VRAM容量时,这种技术特别有用,并且在与编码相关的负载中显示出前景,尽管它仅在该特定上下文中进行了测试。

  17. TOOL · CL_222006 ·

    H3 扩散模型实现更低的显存占用,支持 8GB 显卡兼容

    一位 Reddit 用户对 H3 扩散模型进行了基准测试,证明其所需的显存远低于预期。在 1376x768 分辨率和 243 帧的情况下进行的测试显示,RTX 4070 的峰值显存占用约为 7.0–7.4 GiB。这表明 8GB 显卡可以运行 H3 模型的几种配置,并详细介绍了特定优化和注意力路由以实现兼容性。

  18. TOOL · CL_218701 ·

    指南解释本地部署大语言模型所需的VRAM

    在本地运行大语言模型需要仔细管理VRAM,因为模型大小和量化会显著影响内存使用。虽然没有精确的公式,但可以通过考虑模型的参数数量、权重的比特宽度(例如FP16、INT8、INT4)以及激活和临时缓冲区的开销来估算VRAM需求。Ollama、GPTQ和bitsandbytes等工具可以促进量化,从而减小内存占用。例如,一个量化到INT8的130亿参数模型可能需要大约18 GB的VRAM,这个数字可以使用nvidia-smi等工具进行检查。

  19. COMMENTARY · CL_217456 ·

    Reddit 上正在寻找适用于编码和代理任务的最佳 8GB 显存本地 LLM

    Reddit r/LocalLLaMA 版块的一位用户正在寻求推荐,希望找到能在配备 8 GB 显存的系统上有效运行的最佳本地大型语言模型 (LLM),特别适用于编码和代理编码任务。该用户分享了他们当前的设置,包括一块拥有 8 GB 显存的 RTX 3070 笔记本 GPU,以及他们偏好的模型 Unsloth 的 Qwen3.6-35B-A3B-UD-IQ4_NL,该模型在代理编码任务中能达到大约 25 tokens/s 的速度。他们…

  20. TOOL · CL_212973 ·

    大语言模型推理优化:理解 KV 缓存

    KV 缓存是大语言模型(LLM)推理的关键优化技术,可显著减少自回归文本生成过程中的冗余计算。通过存储先前处理过的 token 的 Keys 和 Values,KV 缓存将矩阵-矩阵乘法转变为更高效的矩阵-向量乘法。这项优化对于理解大语言模型的计算-内存权衡至关重要,因为它增加了内存带宽需求,并与模型权重争夺显存(VRAM),从而影响整体吞吐量和服务成本。