PulseAugur
实时 08:42:54
English(EN) How do you deal with long-context sessions after restarting llama.cpp?

用户寻求 llama.cpp 的自动长上下文状态保存功能

Reddit r/LocalLLaMA 社区的一名用户正在寻求解决方案,以在重启 llama.cpp 应用程序后管理长上下文会话。他们描述了重新预取大型上下文的不便,这可能需要几分钟时间,并提出了一个理想场景:推理服务器自动将对话状态保存到磁盘并恢复。用户指出,虽然 llama-server 等一些工具提供了保存/恢复 API,但更集成、服务器端解决方案将更有益,特别是对于预填充时间较慢的硬件。他们询问其他人是否已经尝试过对流行模型进行此类透明状态管理。 AI

影响 可能提高本地 LLM 推理效率和用户体验。

排序理由 用户生成的关于改进现有软件功能的查询。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

用户寻求 llama.cpp 的自动长上下文状态保存功能

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Dazzling_Equipment_9 ·

    重启 llama.cpp 后如何处理长上下文会话?

    <!-- SC_OFF --><div class="md"><p>I run local models on a 128GB Strix Halo and restart llama.cpp fairly often while testing builds, backends and model parameters. The annoying part is long-running agent sessions. Hermes/OpenCode sessions can easily reach 50k-100k context, and aft…