PulseAugur
实时 08:07:39
实体 llama-server

llama-server

PulseAugur coverage of llama-server — every cluster mentioning llama-server across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 30
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 30 条
  1. TOOL · CL_214083 ·

    新基准测试在硬件上测试本地LLM的上下文窗口限制

    一个新的基准测试“ctx-cliff”已被开发出来,用于评估本地大型语言模型(LLM)在特定硬件配置上能够处理的最大上下文窗口。该基准测试测量预填充和解码速度、挂钟时间,并检测异常情况,以确定模型是否适合实际应用。它强调了特定环境变量的重要性,例如NVIDIA GPU的`GGML_CUDA_ENABLE_UNIFIED_MEMORY=1`,通过启用VRAM到RAM的卸载机制,可以显著影响VRAM利用率并防止碎片化。该工具旨在帮助用户识…

  2. COMMENTARY · CL_203625 ·

    Qwen3.8-27B 模型默认设置引发关于推理努力和速度的争论

    Qwen3.8-27B 模型以高推理努力的默认设置发布,引发了社区对其性能和配置的讨论。早期报告指出,此默认设置可能导致推理时间显著变慢,一位用户生成简单 SVG 图像就等待了 21 分钟。将推理努力调整为较低设置或禁用它可大幅提高速度,使模型更适合交互式使用。同时,模型速度和上下文窗口的优化工作正在进行中,新的存储库和硬件解决方案正在涌现,以增强其在消费级 GPU 和专用硬件上的性能。

  3. COMMENTARY · CL_202744 ·

    Qwen 3.8 27B LLM 因能力获赞,但因过度思考的默认设置而受批评

    阿里巴巴的 Qwen 研究实验室发布了 Qwen 3.8 27B,这是一个开源的、具备视觉能力的 LLM。虽然它因其能力和大小而受到赞扬,适合本地硬件,但用户报告称其默认的推理努力设置会导致过度的“过度思考”。这会导致即使是简单的任务也需要显著更长的处理时间,一些用户难以完成先前版本或其他模型能更快处理的任务。将推理努力设置调整到较低级别可以缓解此问题,尽管一些用户仍在试验以找到最佳配置。

  4. TOOL · CL_189878 ·

    据报道 DeepSeek-V4-Flash 在 DSpark 草稿模型配置下存在性能问题

    Reddit r/LocalLLaMA 版块的一名用户在使用 DSpark 草稿模型配置时,发现 DeepSeek-V4-Flash 模型的性能明显低于 Multi Token Prediction (MTP) 设置。MTP 配置可达到每秒 30-40 个 token 的可观速度,而 DSpark 配置则降至每秒仅 1-2 个 token。该用户正在寻求关于如何正确配置 llama-server 的推测解码以解决此瓶颈的建议,并提供了…

  5. TOOL · CL_188013 ·

    Aider、Qwen Code CLI 和 OpenCode 在本地编码助手基准测试中对决

    对三个本地命令行 AI 编码助手 Aider、Qwen Code CLI 和 OpenCode 的比较,揭示了它们在设置、性能和资源使用方面的显著差异。Aider 和 OpenCode 使用 Ollama 设置起来很简单,而 Qwen Code CLI 需要特定的配置,如 Jinja 模板和更大的上下文窗口才能正常运行。在测试 12 个常见编码任务时,Aider 取得了完美的成功率,OpenCode 有一次部分成功,而 Qwen Co…

  6. TOOL · CL_168141 ·

    llama.cpp 支持本地 GGUF 模型托管及兼容 OpenAI 的 API

    llama.cpp 项目发布了用于在本地运行 GGUF 模型的新工具,包括命令行界面 (llama-cli) 和提供兼容 OpenAI API 的服务器 (llama-server)。该项目提供了关键标志、示例和调整技巧,以帮助用户优化自托管大型语言模型的性能。

  7. TOOL · CL_159461 ·

    llama.cpp 发布 GGUF 模型和兼容 OpenAI API 的工具

    llama.cpp 项目发布了运行 GGUF 模型的新工具,包括命令行界面 (llama-cli) 和服务器 (llama-server)。llama-server 旨在提供兼容 OpenAI 的 API,简化与现有应用程序和工作流程的集成。该项目还提供优化性能的调优技巧和示例。

  8. TOOL · CL_138118 ·

    用户寻求帮助调整 llama-server 缓存以运行大型模型

    一位 Reddit 用户正在寻求有关优化 llama-server 缓存设置的帮助,特别是在运行 Qwen 3.5 122B 等大型模型时。由于上下文长度为 100k 时缓存未命中,他们遇到了显著的处理时间(10-20 分钟)。用户已经配置了几个与缓存相关的参数,包括缓存 RAM 和检查点设置,这些设置已提高了性能。然而,他们仍然遇到检查点遍历时间、用户提示后检查点丢失以及旧检查点消失的问题。他们还在询问使用 K/V 量化进行缓存优化…

  9. COMMENTARY · CL_134442 ·

    用户偏好使用 llama.cpp 而非 Ollama 来执行本地 LLM

    一位用户发现,虽然 Ollama 简化了运行本地大型语言模型的过程,但他们现在更喜欢直接使用 llama.cpp。用户认为 llama.cpp 更简单、更标准,并且更接近实际的模型执行过程。

  10. TOOL · CL_126863 ·

    Llama-server 错误丢弃 KV 缓存,修复恢复快速状态恢复

    llama-server 中的一个错误导致它丢弃了恢复的 KV 缓存,强制进行完全的重新预填充,并显著增加了处理时间。该问题源于服务器的状态保存机制,该机制序列化了 token 数据,但没有序列化高效回滚所需的检查点元数据。成功的修复方法是将此检查点元数据持久化到侧边栏文件中,从而实现更快的状态恢复,并避免冗长的提示重新计算。

  11. TOOL · CL_105758 ·

    llama.cpp web UI 重新编译后失败,CLI 和服务器功能正常

    用户在使用 llama-server web UI 时遇到提示无响应的问题,尽管命令行界面和服务器本身似乎运行正常。web UI 可以加载甚至加载模型,但卡在“处理中...”状态,不返回任何输出。用户还注意到他们的 mcp-servers 不再被识别。这个问题发生在用户在 Debian 13 上重新编译 llama.cpp 项目之后。

  12. SIGNIFICANT · CL_102894 ·

    Empero AI 发布 Qwythos-9B 推理模型,支持 1M 上下文窗口

    empero-ai/Qwythos-9B-Claude-Mythos-5-1M 模型,一个 9B 参数的推理模型,已发布并在 Hugging Face 上可用。该模型基于 Qwen3.5-9B 构建,并使用 Claude Mythos 和 Fable traces 进行微调,通过 YaRN rope-scaling 技术实现了 100 万 token 的上下文窗口。提供了针对各种库和推理提供商的说明和集成指南,包括 llama-cpp…

  13. TOOL · CL_98467 ·

    llama-bench 针对闪存注意力和 GPU 层数进行了默认值更正

    最近为 llama-bench 工具发布的 b9437 版本更正了与闪存注意力和 GPU 层数相关的默认设置。此前,该工具即使在兼容硬件上也将闪存注意力硬编码为关闭,并为 GPU 层数使用了旧的哨兵值。此次更新现在将闪存注意力默认设置为在 सक्षम 硬件(CUDA、Metal、Vulkan)上自动激活,并将 GPU 层数设置为 -1,与其他 llama.cpp 工具(如 llama-server 和 llama-cli)保持一致。此…

  14. TOOL · CL_95108 ·

    Deo 图像到提示工具增加了 LMStudio、Llama Server 支持

    Deo 发布了 1.1 版本,增强了其作为图像到提示生成器的功能。此次更新引入了对 LMStudio 和 Llama Server 的实验性支持,同时通过更严格地遵循提示指南来提高提示的准确性和质量。新功能包括用于精确分割的套索工具、用于简化数据集标记的项目系统,以及用于边界框归一化和提示项完成的错误修复。

  15. TOOL · CL_87794 ·

    Unsloth 发布 0.1.461-beta 版本,修复 GGUF 视觉问题

    Unsloth 发布了 0.1.461-beta 版本,其中包含对其 studio 环境内本地 GGUF 视觉功能的几项修复。这些更新旨在改进系统处理 GGUF 文件的方式,特别是在与 llama-server 交互以及管理变体目录中的伴随文件时。该版本还整合了来自 pre-commit 钩子的自动化代码修复。

  16. COMMENTARY · CL_84667 ·

    超参数搜索为推测性解码带来微小收益

    Reddit的r/LocalLLaMA子版块的一位用户分享了他们对推测性解码进行超参数调整的经验,特别是在Strix Halo平台上使用Qwen3.6 27B模型和“draft-mtp”方法。尽管使用Optuna进行了广泛搜索,但用户发现与默认参数相比,每秒令牌数仅提高了6%。他们提供了实验中使用的Python脚本和最优命令行参数。

  17. MEME · CL_76597 ·

    llama-server 路由为所有 GPU 分配 CUDA 上下文,导致 OOM 错误

    r/LocalLLaMA 子版块的一位用户在使用 llama-server 路由模式时遇到了一个问题:每个模型实例,即使被固定到特定 GPU,也会在所有可用 GPU 上分配 CUDA 上下文。这种行为会导致运行多个模型时出现内存不足 (OOM) 错误,特别是当一个大模型消耗了某些卡上的大部分显存时,导致较小的模型无法在其他 GPU 上初始化其上下文。用户正在寻求解决方案,例如特定的标志或配置,以防止在未使用的 GPU 上分配上下文,或…

  18. TOOL · CL_76190 ·

    开源工具通过 llama.cpp 简化本地 LLM 管理

    两位开发者发布了开源工具,以简化 llama.cpp 的使用。llama.cpp 是一个流行的在本地运行大型语言模型的框架。其中一个工具 llama-launcher 提供了一个点击式图形界面来管理 llama-server 标志,使其对初学者来说易于使用。另一个工具 start-llama 为多个 llama-server 二进制文件提供命令行自定义,并支持每个模型覆盖,旨在实现轻松、单步执行。

  19. COMMENTARY · CL_71889 ·

    LocalLLaMA 用户寻求便携式语音接口以连接本地AI模型

    一位来自 r/LocalLLaMA 子版块的用户正在寻找现有的便携式设备,这些设备可以连接到本地语言模型以进行语音到文本和文本到语音的交互。理想的设备应该是一个小型、无屏幕的小工具,通过Wi-Fi连接到家庭网络,让用户可以通过语音命令查询 Llama-server 等本地模型,并获得语音回复。虽然用户承认有可能使用 Raspberry Pi 构建这样的设备,但他们对现成的解决方案感兴趣,以实现一个简单、适合儿童且完全自托管的语音接口。

  20. MEME · CL_67772 ·

    Qwen3.6 模型在使用 OpenCode 时会在响应中途停止

    Reddit 的 r/LocalLLaMA 论坛上一位用户在使用 OpenCode 和 llama-server 进行 AI 编码时遇到了 Qwen3.6-27B 模型的问题。该模型有时会在生成响应的中途停止,需要用户手动输入“continue”才能恢复。这种行为与服务器崩溃或超时不同,看起来像是输出被故意取消了。