llama.cpp项目已发布多个预发布更新,包括b11514,该更新解决了Musa FWHT修复和针对各种操作系统的平台证明问题。其他版本如b11512和b11511分别侧重于模型修复和CUDA优化。值得注意的是,b11509包含对CUDA CCCL版本保护的修复,而b11505解决了Vulkan TOP_K在处理无限和NaN输入时的问题。这些更新还包括了来自不同开发者的贡献以及与cpp-httplib等库的集成。
AI
<details open=""> <p>CUDA : looped PAD kernel for more than 65535 rows or slices (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/30147">#30147</a>)</p> </details> <p><strong>Website:</strong></p> <ul> <li><a href="https://llama.app" rel="nofo…
<details open=""> <p>CUDA: fix CCCL version guard breaking on major version rollover (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/29453">#29453</a>)</p> <ul> <li>CUDA: fix CCCL version guard breaking on major version rollover</li> </ul> <p…
<details open=""> <p>vulkan : fix TOP_K for +inf/NaN inputs and k = 1 on negative values (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/30107">#30107</a>)</p> <p>The bucket search in topk_nary_search.comp started from the range<br /> [0, 0xF…
<p>vulkan: extend sparse FA support to coopmat2 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/30003">#30003</a>)</p>