实体
llamacpp
llamacpp
PulseAugur coverage of llamacpp — every cluster mentioning llamacpp across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
llamacpp PR 将 ROCm 提示处理速度提升 15%,Q2_K 加速 28 倍
llamacpp 项目的一项新拉取请求旨在显著提高提示处理速度,特别是对于使用 ROCm 的 AMD GPU。此更新还解决了已发现的一个错误,该错误使 Q2_K 量化方法的速度提高了 28 倍。这些优化有望使拥有 AMD 硬件的用户能够使用更极端的量化配置。
-
DeepSeek V4 Flash 通过llamacpp补丁在RTX 5090上本地运行1M上下文
一位用户为llamacpp库开发了一个补丁,使DeepSeek V4 Flash模型能够在RTX 5090显卡上以100万token的上下文窗口本地运行。此修改解决了模型索引问题并实现了一个CUDA内核,将1M上下文的VRAM需求从估计的256GB显著降低到约3.75GB。该补丁已通过needle-in-a-haystack测试验证了其正确性,并提供了改进的预填充速度。
-
用户使用EPYC CPU和4块RTX 3090 GPU构建定制LLM服务器
一位用户完成了强大的定制服务器的组装,该服务器专为运行大型语言模型(LLM)而设计。该配置包括AMD EPYC 9575F处理器、768GB内存以及四块NVIDIA RTX 3090 GPU,总计96GB显存。该服务器旨在通过vLLM等工具运行小型模型,以及使用llama.cpp运行大型模型进行高吞吐量推理,并计划应用于AI驱动的NPC规划的空间模拟中。