PulseAugur
实时 17:50:20
实体 llamacpp

llamacpp

PulseAugur coverage of llamacpp — every cluster mentioning llamacpp across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. MEME · CL_238660 ·

    用户就 KTransformers 与 llamacpp 在 MoE 优化方面寻求建议

    一位 Reddit 用户正在就 KTransformers 和 llamacpp 这两个不同软件库的性能和推理速度寻求建议。该用户特别有兴趣在多 GPU 和 RAM 上使用 FP8 精度优化 Qwen3.8 模型的性能。

  2. TOOL · CL_214233 ·

    用户探索创建自定义GGUF文件以用于LLM

    r/LocalLLaMA上的这篇帖子讨论了为大型语言模型创建自定义GGUF文件的实际操作和好处。用户询问是否值得生成自己的GGUF,特别是结合使用特定硬件加速(如Vulkan或ROCm)编译llama.cpp。讨论还涉及潜在的性能改进以及在较高精度下为特定任务放置模型元素的最佳位置。

  3. TOOL · CL_208220 ·

    ShapeCraft 库提供了实用的 LLM 结构化输出用例

    ShapeCraft 是一个用于 LLM 结构化输出的库,它提供了超越简单数据提取的实用应用程序。通过分配类别和优先级,它可以将非结构化的支持工单转换为可操作的数据;通过定义供应商、总计和项目符号的模式,它可以解析收据和发票等复杂文档。该库还通过确保提取和验证所有必需字段来促进表单驱动的聊天机器人,并支持使用 GBNF 语法进行离线模型执行,以保证输出约束。此外,ShapeCraft 还支持具有独立重试和并发控制的文件批量处理,确保文…

  4. TOOL · CL_153989 ·

    llamacpp PR 将 ROCm 提示处理速度提升 15%,Q2_K 加速 28 倍

    llamacpp 项目的一项新拉取请求旨在显著提高提示处理速度,特别是对于使用 ROCm 的 AMD GPU。此更新还解决了已发现的一个错误,该错误使 Q2_K 量化方法的速度提高了 28 倍。这些优化有望使拥有 AMD 硬件的用户能够使用更极端的量化配置。

  5. TOOL · CL_124527 ·

    DeepSeek V4 Flash 通过llamacpp补丁在RTX 5090上本地运行1M上下文

    一位用户为llamacpp库开发了一个补丁,使DeepSeek V4 Flash模型能够在RTX 5090显卡上以100万token的上下文窗口本地运行。此修改解决了模型索引问题并实现了一个CUDA内核,将1M上下文的VRAM需求从估计的256GB显著降低到约3.75GB。该补丁已通过needle-in-a-haystack测试验证了其正确性,并提供了改进的预填充速度。

  6. TOOL · CL_72255 ·

    用户使用EPYC CPU和4块RTX 3090 GPU构建定制LLM服务器

    一位用户完成了强大的定制服务器的组装,该服务器专为运行大型语言模型(LLM)而设计。该配置包括AMD EPYC 9575F处理器、768GB内存以及四块NVIDIA RTX 3090 GPU,总计96GB显存。该服务器旨在通过vLLM等工具运行小型模型,以及使用llama.cpp运行大型模型进行高吞吐量推理,并计划应用于AI驱动的NPC规划的空间模拟中。