NInfer
PulseAugur coverage of NInfer — every cluster mentioning NInfer across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
NInfer 分叉将 LLM 上下文提升至 555k,采用 4 位 KV 缓存
NInfer 项目的一个分叉已被开发出来,为大型语言模型的上下文长度和内存管理带来了显著的改进。该分叉采用自定义的 4 位 KV 缓存,可在不损失质量的情况下将 VRAM 使用量减少 45%,并通过 LongBench 和 AIME 等基准测试得到验证。它还将 Qwen 等模型的上下文窗口扩展到 555k token 以上,并预计在高 端 GPU 上可达 800 万 token。该项目增强了多级前缀重用,并实现了一个强大的主机 KV …
-
本地 LLM 生成器学会根据视频输出来自我纠正代码
一位开发者增强了他的“auto_demo_scener”项目,该项目使用本地 LLM 生成演示场景效果。最新的更新集成了 Ninfer 支持和一个新功能,允许 LLM 查看自己生成的代码和视频输出,然后对其进行修改以获得视觉改进。这种反馈循环通过分析渲染结果,帮助模型纠正错误,例如屏幕利用不当或逻辑缺陷。
-
NInfer、llama.cpp、vLLM 在 Qwen3.8-27B 上的速度和质量对比
一位用户在一台 RTX 5090 GPU 上使用 Qwen3.8-27B 模型对三种推理引擎——NInfer、llama.cpp 和 vLLM——进行了性能比较。评估重点关注生产内容智能管道的质量和速度,采用了包含六个层级的真实世界任务的自定义测试框架,包括相关性分类、关键信息检索和多笔录问答。与 llama.cpp 相比,NInfer 和 vLLM 在上下文处理能力方面表现更优,NInfer 在笔录问答和推理任务中展现出最高的质量,…
-
NInfer 分叉为双 5090 上的 Qwen-3.8 27B 实现 1M 上下文
对 NInfer C++20/CUDA 推理引擎的一个分叉已被开发出来,以支持 Qwen-3.8 27B 模型 100 万个 token 的上下文窗口。这个增强版本运行在双 5090 GPU 上,与 vLLM 相比,在解码时实现了显著更高的 token/秒速率,尤其是在超出基础模型的原生上下文限制时。虽然 vLLM 提供更快的预填充时间,但 NInfer 分叉在极端上下文长度下展示了改进的内存效率和持续的解码性能。
-
NInfer 将本地 LLM 性能在 5090 GPU 上提升至 220 tokens/sec
Reddit r/LocalLLaMA 版块的一位用户分享了他们使用 NInfer 和 5090 GPU 运行 270 亿参数模型的积极体验。他们报告称吞吐量显著提高,平均速度为每秒 170-220 个 token,这比他们使用 llama.cpp 的体验快了一倍多。该用户详细介绍了他们的具体设置,包括使用的命令以及模型服务、上下文长度和量化等各种参数。
-
NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍
一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。
-
Qwen 模型通过 "Sharp" 提示叠加器在 NInfer 上变得更简洁
一位用户开发了一种方法,通过将 "Sharp" 系统提示叠加器应用于 NInfer 推理引擎,使 Qwen 模型更加简洁。此修改将输出 token 减少了 42%,同时不影响速度或正确性。该叠加器是用 C++ 实现的,以绕过 NInfer 的模板验证,允许将 "Sharp" 指令附加到系统提示中,从而控制模型的冗长程度和推理开销。
-
Qwen3.8-27B 模型使用 NInfer 引擎在单张 RTX 5090 上达到 880 tok/s
一位用户在使用单张 RTX 5090 GPU 运行 Qwen3.8-27B 模型时取得了令人印象深刻的性能,在 4 位 NVFP4 量化和完整的 262k 上下文下达到了每秒 880 个 token。该速度是通过使用 NInfer 引擎实现的,用户报告称其比 llama.cpp 等其他引擎快得多。基准测试结果表明,这款 NVFP4 量化模型在 HumanEval+ 和 AIME 等任务上的表现与整数量化版本相当,同时速度却显著更快。
-
NInfer 更新使 RTX 4090 上的 Qwen 3.8-27B 支持 350K token 上下文
一位用户更新了他们 fork 的 NInfer(一个用于在本地运行大型语言模型的工具),以支持 Qwen 3.8-27B 模型。此次更新允许在单个 RTX 4090 GPU 上实现高达 250-350K token 的上下文窗口,而无需系统 RAM。这些优化还使得某些工作负载的生成速度达到每秒 80-160 token。
-
NInfer 为 Qwen3.8-27B 模型增加了 day-zero 支持,并进行了引擎改进
NInfer 推理引擎已为新的 Qwen3.8-27B 模型发布了 day-zero 支持,支持本地部署和实验。此次更新带来了显著的引擎改进,包括支持多达 8 个并发请求(具有共享 KV 缓存)以及实现 ReplaySSM 以降低内存开销。这些优化使得在单个 RTX 5090 GPU 上能够实现约 200 token/秒 的生成速度,即使在使用投机解码的情况下。
-
NInfer 引擎在单张 RTX 5090 上实现 Qwen3.6 542 tok/s
一款名为 NInfer 的全新推理引擎,使用 C++/CUDA 从头开始构建并已开源,展示了 Qwen3.6-35B-A3B 模型令人印象深刻的性能。该引擎在单张 RTX 5090 GPU 上实现了 65,536 token 全量补全的持续速度 542 token/秒。通过自定义量化、内核融合和其他深度流水线增强实现了这一优化,使得 NInfer 高度专注于特定的 Qwen3.6 检查点。