实体
pwilkin
pwilkin
PulseAugur coverage of pwilkin — every cluster mentioning pwilkin across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
llama-bench 针对闪存注意力和 GPU 层数进行了默认值更正
最近为 llama-bench 工具发布的 b9437 版本更正了与闪存注意力和 GPU 层数相关的默认设置。此前,该工具即使在兼容硬件上也将闪存注意力硬编码为关闭,并为 GPU 层数使用了旧的哨兵值。此次更新现在将闪存注意力默认设置为在 सक्षम 硬件(CUDA、Metal、Vulkan)上自动激活,并将 GPU 层数设置为 -1,与其他 llama.cpp 工具(如 llama-server 和 llama-cli)保持一致。此…
-
DeepSeek V4 Flash 模型在 llama.cpp 中获得早期支持
一个拉取请求正在进行中,旨在将 DeepSeek V4 Flash 模型添加到 llama.cpp 库中。尽管目前处于早期、缓慢且不稳定的阶段,但该模型因其相对于其大小的智能而受到赞扬,使其能够与前沿模型相媲美。它对量化和上下文窗口缩放的高效处理也使其非常适合本地推理,有可能主导 80-140GB 模型领域。
-
StepFun 3.5 MTP 模型集成到 llama.cpp
一个名为 StepFun 3.5 MTP 的新模型已通过向 llama.cpp 项目提交的拉取请求引入。该模型似乎是 Gemma MTP 的后继者,其集成到 llama.cpp 是一个关键的开发。