llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-14 11:26
<details open=""> <p>kleidiai : add SME2 f32 kernel (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24414">#24414</a>)</p> <ul> <li> <p>kleidiai : add SME2 f32 kernel</p> </li> <li> <p>enable dynamic scheduling for SME2 f32 kernel</p> </li> <…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-14 10:43
<details open=""> <p>arg: Flush log before exiting after usage() (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25504">#25504</a>)</p> <p>Under certain conditions, it's possible for messages emitted via LOG()<br /> to get lost before exit, a…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-14 09:48
<details open=""> <p>sycl: set fattn_vec_nthreads to 256 for Battlemage (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25205">#25205</a>)</p> <p>Currently detects lunarlake + battlemage / xe2 and<br /> sets the value to 256.</p> <p>Keeps def…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-14 05:30
<details open=""> <p>metal : add Q2_0 support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25419">#25419</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b9994…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 23:10
<details open=""> <p>model: add Hy3 (hy_v3) support with MTP speculative decoding (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25395">#25395</a>)</p> <ul> <li>model: add Hy3 (hy_v3) architecture support</li> </ul> <p>Adds Tencent Hunyuan 3…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 21:06
<details open=""> <p>CUDA: refactor MMQ kernel configuration (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24127">#24127</a>)</p> <ul> <li> <p>CUDA: refactor MMQ kernel configuration</p> </li> <li> <p>fix Blackwell config</p> </li> <li> <p>…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 19:53
<details open=""> <p>spec: add Minimax2 eagle3 support</p> <ul> <li> <p>Fix nullptr in minimax2 EAGLE3</p> </li> <li> <p>minor : add newline</p> </li> </ul> <hr /> <p>Co-authored-by: Georgi Gerganov <a href="mailto:[email protected] ">[email protected] </a></p> </details> <p><s…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 19:12
<details open=""> <p>tests: Harmonize header use (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25616">#25616</a>)</p> <ul> <li> <p>tests: Harmonize the use of private ggml includes</p> </li> <li> <p>tests: In test-backend-ops, use quoted in…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 15:42
<details open=""> <p>gguf : add tensor shape accessor (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24405">#24405</a>)</p> <ul> <li> <p>gguf : add tensor shape accessors</p> </li> <li> <p>gguf : return tensor shape as const int64_t *</p> </…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 09:08
<details open=""> <p>chat : fix reasoning leak with force-opened bare templates (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24674">#24674</a>)</p> <ul> <li>chat : fix reasoning leak with force-opened bare templates</li> </ul> <p>The reaso…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 08:34
<details open=""> <p>sycl: add fused top-k MoE (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25217">#25217</a>)</p> <ul> <li> <p>sycl: add fused top-k MoE</p> </li> <li> <p>sycl: address review: GGML_SYCL_ENABLE_FUSION env, move fusion disp…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 07:40
<details open=""> <p>sycl: add Q2_K to DMMV reorder path (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25064">#25064</a>)</p> <p>Signed-off-by: Todd Malsbary <a href="mailto:[email protected] ">[email protected] </a></p> </details…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 01:30
<details open=""> <p>server: honour per-request reasoning_budget_tokens in chat completions (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23116">#23116</a>)</p> <ul> <li>server: honour per-request reasoning_budget_tokens in chat completions…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 00:55
<details open=""> <p>vendor : update cpp-httplib to 0.50.1 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25576">#25576</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/d…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-13 00:08
<details open=""> <p>server: Don't consider models with --no-mmproj-auto as multimodal (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25590">#25590</a>)</p> <p>If mmproj is explicitly disabled via the model preset or command-line<br /> param…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 23:38
<details open=""> <p>mtmd: fix silent prompt truncation on embedded NUL (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25548">#25548</a>)</p> <ul> <li>mtmd: fix silent prompt truncation on embedded NUL</li> </ul> <p>mtmd_input_text carried t…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 21:34
<details open=""> <p>server : evict checkpoints within min-step of each other (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25472">#25472</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/l…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 16:19
<details open=""> <p>server : fix image blocks in tool_result being dropped during Anthropic OpenAI conversion (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/22536">#22536</a>)</p> <ul> <li>server : fix image blocks in tool_result being drop…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 14:50
<details open=""> <p>gguf : reject empty metadata keys (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24917">#24917</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/downl…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 14:19
<details open=""> <p>cuda: Don't crash when querying memory on device with no free memory. (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25157">#25157</a>)</p> <p>If a Cuda device has no or limited available memory, the actual call<br /> to…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 13:41
<details open=""> <p>DeepseekV4: clear cache only for seq rather than full (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25521">#25521</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llam…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 13:10
<details open=""> <p>server: allow stream for exec_shell_command (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25526">#25526</a>)</p> <ul> <li> <p>init stream</p> </li> <li> <p>add stream for shell tool</p> </li> <li> <p>add test</p> </li> …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 12:38
<details open=""> <p>server: refactor server_stream (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25541">#25541</a>)</p> <ul> <li> <p>server: refactoring, remove spipe from server_http_res</p> </li> <li> <p>wip</p> </li> <li> <p>remove non-…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 12:05
<details open=""> <p>ggml : add GGML_OP_LIGHTNING_INDEXER that implements DeepSeek V3.2/V4 lightning indexer (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24231">#24231</a>)</p> <ul> <li> <p>ggml : add GGML_OP_LIGHTNING_INDEXER that impleme…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 05:32
<details open=""> <p>Vulkan: route large matmuls to medium tile on Adreno (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24877">#24877</a>)</p> <ul> <li>[Vulkan] Fixes llama-cli breaking over longer promts sizes</li> </ul> <p>The llama-cli w…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-12 01:14
<details open=""> <p>opencl: add int8 dp4 dense and MoE prefill optimization for Adreno GPUs (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25537">#25537</a>)</p> <ul> <li> <p>opencl: add int8 dp4 dense and moe GEMM</p> </li> <li> <p>opencl:…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 18:56
<details open=""> <p>llama : make tensor-split regex patterns static (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24710">#24710</a>)</p> <p>llama_meta_device_get_split_state() recompiled 29 std::regex on every call.<br /> In -sm tensor mod…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 18:12
<details open=""> <p>hexagon: improve ARGSORT performance for small tensors (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25512">#25512</a>)</p> <ul> <li> <p>hex-sort: add efficient bitomic sort in hvx regs up to 1024 elements</p> </li> <li…
llama.cpp — Releases
TIER_1
(SO)
·
kdkd
·
2026-07-11 18:03
<p>Fix conditional to display 'LLAMA_SPLIT_MODE_TENSOR not implemented f…</p>
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 10:54
<details open=""> <p>arg: prevent duplicate spec model downloads (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25527">#25527</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/rele…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 08:40
<details open=""> <p>mtmd: deepseek-ocr v1 multi-tile (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24717">#24717</a>)</p> <ul> <li> <p>mtmd: deepseek-ocr v1 multi-tile dynamic resolution + unified image-preprocessors for both versions (ds-…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 08:03
<details open=""> <p>server: remove loading.html (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25500">#25500</a>)</p> <ul> <li> <p>server: remove loading.html</p> </li> <li> <p>apply ui changes</p> </li> </ul> </details> <p><strong>macOS/iO…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-11 06:46
<details open=""> <p>sync : ggml</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b9959/llama-b9959-bin-macos-arm64.tar.gz">macOS Apple Silicon (arm64)</a></li> <li>macOS Apple Silicon (arm64, KleidiAI ena…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 20:19
<details open=""> <p>server: improve tools, remove apply_diff (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25498">#25498</a>)</p> <ul> <li> <p>server: improve tools, remove apply_diff</p> </li> <li> <p>improve edit tool</p> </li> <li> <p>a…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 19:48
<details open=""> <p>cli: fix crash on wrong server base url (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25497">#25497</a>)</p> <ul> <li> <p>llama-cli: fix crash on wrong server base url by catching exceptions and graceful exit</p> </li> …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 17:20
<details open=""> <p>llama : make all KQ masks f16 if FA is used, remove zero attention bias, remove raw_k repeats in DeepSeek V4 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25370">#25370</a>)</p> <ul> <li> <p>llama : make all KQ masks (e…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 14:17
<details open=""> <p>llama-batch: add unit test (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25471">#25471</a>)</p> <ul> <li> <p>llama-batch: add unit test</p> </li> <li> <p>fix win32 builds</p> </li> <li> <p>add not implemented assertion …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 10:39
<details open=""> <p>opencl: cluster-parallel decode FA for Adreno (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25473">#25473</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/re…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 07:45
<details open=""> <p>ggml : process data in smaller chunks in CUDA ggml_top_k() and ggml_argsort() to reduce temporary buffers memory usage (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24776">#24776</a>)</p> <ul> <li> <p>ggml : process dat…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-10 04:48
<details open=""> <p>cli: add --output option (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25484">#25484</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b9947…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 22:22
<details open=""> <p>hexagon: tiling, tracing and optimizations for unary ops (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25474">#25474</a>)</p> <ul> <li> <p>hexagon: tile wide rows in pointwise unary ops to avoid VTCM overflow</p> </li> …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 21:48
<details open=""> <p>server : move chat-template thinking probe inside the init try/catch (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24093">#24093</a>)</p> <p>A model whose chat template parses at init but fails parser generation<br /> a…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 20:19
<details open=""> <p>Only index by compile times + always multiply/add (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25445">#25445</a>)</p> <p>The first one avoids relying on compile to optimize local memory away,<br /> and the second is ch…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 11:39
<details open=""> <p>llama-bench : init params.offline (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25476">#25476</a>)</p> <p>Signed-off-by: Adrien Gallouët <a href="mailto:[email protected] ">[email protected] </a></p> </details> <p><st…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 11:01
<details open=""> <p>metal : add CONV_2D_DW (depthwise convolution) support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/21565">#21565</a>)</p> <ul> <li> <p>metal : add CONV_2D_DW (depthwise 2D convolution) support</p> </li> <li> <p>test :…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 10:10
<details open=""> <p>ggml-hip: enable -funsafe-math-optimizations (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24668">#24668</a>)</p> <p>CUDA is compiled with fast math and AMD/HIP is not — this flag lets AMD use fast math too.</p> <p>We c…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 08:31
<details open=""> <p>cuda: align snake fusion matcher with the other backends (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25460">#25460</a>)</p> <ul> <li>cuda: fix snake fusion type predicate, a and inv_b are F32</li> </ul> <p>The matcher…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 07:11
<details open=""> <p>server : respect min-step when splitting prompt batches (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25420">#25420</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/ll…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 05:33
<details open=""> <p>hexagon: add VISION RoPE support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25216">#25216</a>)</p> <ul> <li> <p>hexagon: add VISION RoPE support</p> </li> <li> <p>hexagon: support RoPE on strided half-dim views for a…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-09 00:20
<details open=""> <p>ggml-webgpu: tune subgroup split (d_split) in flash_attn_vec (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25418">#25418</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-o…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 23:24
<details open=""> <p>opencl: Q6_K GEMM/GEMV fix for ne01 of weights that are not multiples of 128. (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25464">#25464</a>)</p> <ul> <li>opencl: fix garbled output for Q6_K weights with ne01 % 128 != …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 21:47
<details open=""> <p>vulkan: disable FA mask_opt on GCN to improve performance (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24362">#24362</a>)</p> <ul> <li> <p>vulkan: disable FA mask_opt on GCN to improve performance</p> </li> <li> <p>ree…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 21:13
<details open=""> <p>opencl: ragged-tile MoE prefill FP16 GEMM optimization (skip padded expert tiles) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25433">#25433</a>)</p> <ul> <li>opencl: ragged-tile MoE prefill GEMM (skip padded expert ti…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 20:38
<details open=""> <p>llama-batch: fix allowed decreasing pos in a seq (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25449">#25449</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 19:55
<details open=""> <p>vulkan: for small AMD GPUs, reduce submission threshold based on CU count (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25240">#25240</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://gith…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 19:17
<details open=""> <p>hexagon: new vtcm layouts and improved pipelines for MUL_MAT, MUL_MAT_ID and FLASH_ATTN_EXT (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25425">#25425</a>)</p> <ul> <li> <p>hex-fa: refactor kernel param compute to use …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 18:30
<details open=""> <p>cli : move to HTTP-based implementation (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24948">#24948</a>)</p> <ul> <li> <p>cli: move to HTTP-based implementation</p> </li> <li> <p>wip</p> </li> <li> <p>working</p> </li> …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 16:59
<details open=""> <p>cuda : add support for f16->f16 GGML_OP_SET_ROWS (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25367">#25367</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 16:14
<details open=""> <p>llama: refactor fused ops (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24646">#24646</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b992…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 15:28
<details open=""> <p>server-stream: follow-up on SSE Replay Buffer (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23226">#23226</a>) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25047">#25047</a>)</p>…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 14:53
<details open=""> <p>llama-batch: add n_keep_tail in split_equal for recurrent models (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25278">#25278</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/gg…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 13:34
<details open=""> <p>metal : add set_rows with src0 f16 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25434">#25434</a>)</p> <p>Co-authored-by: Georgi Gerganov <a href="mailto:[email protected] ">[email protected] </a></p> </details> <p><…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 12:22
<details open=""> <p>ggml : fix A indexing in simd_gemm scalar tail-column path (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25390">#25390</a>)</p> <p><code>simd_gemm()</code> has an incorrect A-matrix index in the scalar tail-column path …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 11:49
<details open=""> <p>ggml : add support for CPU f16->f16 GGML_OP_SET_ROWS (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25344">#25344</a>)</p> <ul> <li> <p>ggml : add support for CPU f16->f16 GGML_OP_SET_ROWS</p> </li> <li> <p>ggml : …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 11:14
<details open=""> <p>opencl: fix potential crash in aos reconstruct (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25383">#25383</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/r…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 10:35
<details open=""> <p>Add Q2_0 quantization: type definition and CPU backend (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24448">#24448</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/lla…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 07:56
<details open=""> <p>spec : fix naming, spacing (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25410">#25410</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b99…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 07:00
<details open=""> <p>CUDA: Fuse MMVQ post-scale for NVFP4 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24481">#24481</a>)</p> <ul> <li>CUDA: Fuse MMVQ for NVFP4 and BS 1</li> </ul> <p>TODO:</p> <ol> <li>Add tests to test-backend-ops (did v…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 04:26
<details open=""> <p>server : fix draft model fit vs load inconsistency (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25056">#25056</a>)</p> <ul> <li> <p>fix: draft model fit vs load inconsistency</p> </li> <li> <p>refactor(server): unify d…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 03:34
<details open=""> <p>server : add timings and progress to /responses API stream (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25348">#25348</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 02:55
<details open=""> <p>server: enforce prompt cache RAM limit (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25070">#25070</a>)</p> <p>Before this commit, --cache-ram was not a hard limit:</p> <ul> <li>The cache always kept at least one entry,…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 02:22
<details open=""> <p>common : add missing include in common.h (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25220">#25220</a>)</p> <p>Signed-off-by: zhangrunda <a href="mailto:[email protected] ">[email protected] </a></p> <…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 01:51
<details open=""> <p>ggml-hip : add -fno-finite-math-only alongside -ffast-math (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25373">#25373</a>)</p> <p>-ffast-math implies -ffinite-math-only under ROCm/clang 22, which<br /> disables INFINIT…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-08 00:25
<details open=""> <p>llama: fix quantized kv-cache for dsv4 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25202">#25202</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 23:50
<details open=""> <p>[SYCL] fix unsupported UT cases of CONT & CPY (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25231">#25231</a>)</p> <ul> <li> <p>fix unsupported UT cases of CONT & CPY</p> </li> <li> <p>update ops.md</p> </li> <l…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 17:17
<details open=""> <p>[SYCL] support OP cross_entropy_loss, cross_entropy_loss_back (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25236">#25236</a>)</p> <ul> <li> <p>support OP cross_entropy_loss, cross_entropy_loss_back</p> </li> <li> <p>co…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 16:43
<details open=""> <p>sycl : set K_QUANTS_PER_ITERATION to 1 on DMMV path (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25063">#25063</a>)</p> <ul> <li>sycl: add supported types to ggml_sycl_supports_reorder_dmmv</li> </ul> <p>The reordered …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 15:20
<details open=""> <p>sycl : enhance argsort to support all UT cases (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25125">#25125</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/r…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 14:20
<details open=""> <p>sycl : use sycl func to fix AOT double type issue (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25081">#25081</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cp…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 13:23
<details open=""> <p>sycl : rename the env vars from "disable" to "enable" (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25042">#25042</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llam…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 09:38
<details open=""> <p>speculative : fix out-of-bounds read in ngram-map on prompt shrink (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23936">#23936</a>)</p> <ul> <li> <p>speculative : fix out-of-bounds read in ngram-map on prompt shrink</p>…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 05:31
<details open=""> <p>vulkan : check src0 type in GGML_OP_SET_ROWS to avoid failures due to unimplemented f16 support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25351">#25351</a>)</p> <ul> <li> <p>vulkan : check src0 type in GGML_OP_SET_R…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-07 03:39
<details open=""> <p>opencl: general flash attention decode performance optimizations (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25366">#25366</a>)</p> <ul> <li> <p>opencl: vec flash-attention decode kernels for f16/q8_0/q4_0 KV</p> </li…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 22:07
<details open=""> <p>common: Set optimal default thread count for ppc ( linux as well as AIX) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25237">#25237</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://githu…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 21:24
<details open=""> <p>metal: add col2im_1d op (f32/f16/bf16) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25176">#25176</a>)</p> <ul> <li>metal: add col2im_1d op (f32/f16/bf16)</li> </ul> <p>Gather kernel mirroring the CPU/CUDA path: each o…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 20:47
<details open=""> <p>CUDA: remove -sm row, refactor cuBLAS (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24216">#24216</a>)</p> <ul> <li> <p>CUDA: remove -sm row, refactor cuBLAS</p> </li> <li> <p>fix CDNA + BF16 logic</p> </li> <li> <p>fix…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 14:59
<details open=""> <p>CUDA: extend K-type validation to V-types for flash attention (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24403">#24403</a>)</p> <ul> <li> <p>CUDA: extend K-type validation to V-types for flash attention</p> </li> <li…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 11:48
<details open=""> <p>ggml-cpu: use UE4M3 LUT in ARM NVFP4 dot product (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25331">#25331</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 11:06
<details open=""> <p>ggml-cpu: Enable tiled matmul on AIX (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25199">#25199</a>)</p> <p>The matmul_tiled path uses large local stack buffers for A_pack and B_pack. On AIX this can trigger a segmenta…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 09:37
<details open=""> <p>vulkan: fix 32-bit integer overflow in CEIL_DIV (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25245">#25245</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 09:03
<details open=""> <p>scripts : use HF_TOKEN when downloading UI assets (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25280">#25280</a>)</p> <p>Signed-off-by: Adrien Gallouët <a href="mailto:[email protected] ">[email protected] </a></p> <…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-06 08:24
<details open=""> <p>ggml-hip: enable -ffast-math for HIP builds (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23862">#23862</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/rele…
llama.cpp — Releases
TIER_1
(SO)
·
adavyas
·
2026-07-06 03:49
<p>ggml-cuda: optimize conv_transpose_1d indexing (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25310">#25310</a>)</p>
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-05 19:44
<details open=""> <p>Fix stale tensor-split params for draft models (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24814">#24814</a>)</p> <ul> <li> <p>meta: fix tensor split metadata for GQA attention</p> </li> <li> <p>Tidied the code a bit …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-05 19:14
<details open=""> <p>abort if we see a multi buffer (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25276">#25276</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-05 18:30
<details open=""> <p>ggml : fix tensor-parallel + -ncmoe crash on MoE models (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25028">#25028</a>)</p> <p>Tensor parallelism (-sm tensor) combined with -ncmoe (CPU-offloaded MoE<br /> experts) abor…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-05 15:55
<details open=""> <p>cuda : concat implementation for quantized types (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25303">#25303</a>)</p> <ul> <li> <p>cuda : concat implementation for quantized types</p> </li> <li> <p>chore : apply am17an …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-04 21:11
<details open=""> <p>llama : add guard for K/V rotation input when buffer is unallocated (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25215">#25215</a>)</p> <p>llm_graph_input_attn_kv::set_input and llm_graph_input_attn_kv_iswa::set_input<…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-04 12:17
<details open=""> <p>ggml : fix broken CPU concat implementation for quantized types (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25247">#25247</a>)</p> <ul> <li> <p>ggml : fix broken CPU concat implementation for quantized types</p> </li>…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 21:40
<details open=""> <p>chat: trim messages sent to StepFun parser (fixes long reasoning loops) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25238">#25238</a>)</p> <ul> <li> <p>chat: trim messages sent to StepFun parser (fixes long reasoning …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 14:57
<details open=""> <p>spec: support spec-draft-p-min in DFlash (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25246">#25246</a>)</p> <ul> <li> <p>spec: support spec-draft-p-min in DFlash</p> </li> <li> <p>dflash: add n_min guard</p> </li> <li…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 14:22
<details open=""> <p>cuda: enable topk-moe fusion for 288 experts (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25267">#25267</a>)</p> <ul> <li>cuda: enable topk-moe fusion for 288 experts</li> </ul> <p>The topk-moe fusion only accepted pow…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 11:30
<details open=""> <p>server + ui: ping silent SSE streams every 1s and kick only after 3s so slow prefill never drops healthy connections (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25241">#25241</a>)</p> <ul> <li> <p>server + ui: ping si…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 09:42
<details open=""> <p>Remove redundant CUDA copies after gated_delta_net. (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23940">#23940</a>)</p> <ul> <li>Remove redundant CUDA copies after gated_delta_net.</li> </ul> <p>Currently, GDN writes r…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-03 09:07
<details open=""> <p>vendor : update cpp-httplib to 0.49.0 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25218">#25218</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/d…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-02 16:29
<details open=""> <p>llama : add llama_model_ftype_name() (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25134">#25134</a>)</p> <ul> <li>llama : add llama_model_ftype_name()</li> </ul> <p>Expose the model file type (quantization) name, e.g. …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 18:11
<details open=""> <p>opencl: allow loading precompiled binary kernels from library (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23042">#23042</a>)</p> <ul> <li> <p>opencl: allow loading binary kernel</p> </li> <li> <p>opencl: add libdl.h</…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 17:11
<details open=""> <p>common : use hf primary split as model path (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25194">#25194</a>)</p> <p>Fixes <a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/issues/25181">#25…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 14:42
<details open=""> <p>hexagon: flash attention rework (optimizations, accuracy improvements, etc) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25085">#25085</a>)</p> <ul> <li> <p>hex-mm: fold mm quant tasks into the main matmul threads</p> …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 11:11
<details open=""> <p>CUDA: consistent use of <strong>restrict</strong> + PDL for FA (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25185">#25185</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 10:17
<details open=""> <p>ggml-cpu: add AVX2 optimization for nvfp4 dot product and use UE4M3 LUT (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23961">#23961</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github…
llama.cpp — Releases
TIER_1
(SO)
·
allozaur
·
2026-07-01 05:32
<p>ui: Remove PWA navigate fallback to prevent caching API endpoint requ…</p>
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-07-01 05:13
<details open=""> <p>opencl: initial q1_0 support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25160">#25160</a>)</p> <ul> <li> <p>opencl: general q1_0 support</p> </li> <li> <p>opencl: add Adreno GEMM/GEMV for q1_0</p> </li> </ul> </detai…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 19:37
<details open=""> <p>cuda : prevent integer truncation and overflow errors when using KQ mask strides in flash_attn_mask_to_KV_max kernel (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24945">#24945</a>)</p> <p>Co-authored-by: Stanisław Szym…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 16:55
<details open=""> <p>model : register t_layer_inp for qwen3next (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25141">#25141</a>)</p> <ul> <li>Fix input assignment in layer processing loop</li> </ul> <p>Fix DFLASH for qwen-coder-next</p> <ul…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 14:57
<details open=""> <p>common,server: handle bracketed IPv6 literals in URL authority (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25140">#25140</a>)</p> <ul> <li>common,server: handle bracketed IPv6 literals in URL authority</li> </ul> <p>P…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 14:11
<details open=""> <p>CUDA: fix get_rows_back for tables with more than 65535 rows (grid-y clamp + stride) (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25103">#25103</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="h…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 13:18
<details open=""> <p>CUDA: fix Gemma E4B MTP FlashAttention (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25148">#25148</a>)</p> <ul> <li> <p>CUDA: fix Gemma E4B MTP FlashAttention</p> </li> <li> <p>remove unused template declaration</p> </…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 11:04
<details open=""> <p>vulkan: roll bk loop in matmul for asahi linux (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24663">#24663</a>)</p> <ul> <li> <p>vulkan: roll bk loop in matmul for asahi linux</p> </li> <li> <p>vulkan: fix inline commen…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 08:58
<details open=""> <p>ggml-webgpu: add support for NVFP4 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25143">#25143</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/down…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-30 01:19
<details open=""> <p>Revert "sched : reintroduce less synchronizations during split compute (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/20793">#20793</a>)" (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/p…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-29 16:20
<details open=""> <p>common : dedup preset and cached model entries in /v1/models (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25131">#25131</a>)</p> <p>Signed-off-by: Adrien Gallouët <a href="mailto:[email protected] ">[email protected] …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-29 10:27
<details open=""> <p>DeepSeek V4 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24162">#24162</a>)</p> <ul> <li> <p>convert: add dsv4 conversion</p> </li> <li> <p>add basic setup</p> </li> <li> <p>add llm_graph_input_dsv4</p> </li> <li> <p>a…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-29 09:47
<details open=""> <p>tools/ui: restore Tailwind scanning in ignored worktrees (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24879">#24879</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/l…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-29 07:36
<details open=""> <p>common : remove unused regex-partial (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25118">#25118</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/do…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-29 00:07
<details open=""> <p>jinja, chat: add --reasoning-preserve flag (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25105">#25105</a>)</p> <ul> <li> <p>jinja, chat: add --reasoning-preserve flag</p> </li> <li> <p>correct help message</p> </li> </…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 19:38
<details open=""> <p>ui: fix stop and reasoning skip in single-model mode (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25084">#25084</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 15:34
<details open=""> <p>chat : implement minicpm5 parser (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24889">#24889</a>)</p> <ul> <li> <p>Add minicpm5 tool call parser</p> </li> <li> <p>Refactor MiniCPM5 PEG parser per review feedback</p> </l…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 14:20
<details open=""> <p>jinja: add --dump-prog for debugging (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25086">#25086</a>)</p> <ul> <li> <p>jinja: add --dump-prog for debugging</p> </li> <li> <p>Update common/jinja/runtime.cpp</p> </li> </u…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 13:40
<details open=""> <p>spec : add DFlash support (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/22105">#22105</a>)</p> <ul> <li> <p>spec: add DFlash v2 support</p> </li> <li> <p>dflash: support sliding window attention per layer_types</p> </li…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 11:05
<details open=""> <p>common : allow --offline in llama download (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25091">#25091</a>)</p> <p>Expose the existing --offline flag to <code>llama download</code> so a script can<br /> run it to check …
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-28 06:48
<details open=""> <p>logs : reduce v2 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25078">#25078</a>)</p> <ul> <li> <p>server : reduce logs</p> </li> <li> <p>cont : common</p> </li> <li> <p>cont : spec</p> </li> <li> <p>cont : CMN_ -> C…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 23:21
<details open=""> <p>opencl: flash attention improvement (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25069">#25069</a>)</p> <ul> <li> <p>opencl: rework FA kernel for f16 and f32</p> </li> <li> <p>opencl: flash-attention prefill prepass ke…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 12:50
<details open=""> <p>[CUDA] Added a cudaMemcpy2DAsync fast path to ggml_cuda_cpy (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25057">#25057</a>)</p> <ul> <li>[CUDA] Added a cudaMemcpy2DAsync fast path to ggml_cuda_cpy</li> </ul> <p>Add a C…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 11:02
<details open=""> <p>sycl : fix failed ut cases of norm (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25044">#25044</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/down…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 10:33
<details open=""> <p>vulkan: fix step operator for 0 input (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25036">#25036</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/d…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 10:05
<details open=""> <p>binaries : Improve rpc-server and export-graph-ops names. (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25045">#25045</a>)</p> <p>Tests are generally prefixed with -test, so rename export-graph-ops<br /> accordingly.</p…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 09:14
<details open=""> <p>ci : add windows-openvino to check-release (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25022">#25022</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/relea…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-27 08:39
<details open=""> <p>tests : fix test-chat-template --no-common option (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25075">#25075</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cp…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 21:57
<details open=""> <p>app : allow --version, --licenses & --help (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25054">#25054</a>)</p> <p>Signed-off-by: Adrien Gallouët <a href="mailto:[email protected] ">[email protected] </a></p> </de…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 18:37
<details open=""> <p>sched : reintroduce less synchronizations during split compute (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/20793">#20793</a>)</p> <ul> <li> <p>CUDA: Improve performance via less synchronizations between token (<a clas…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 17:29
<details open=""> <p>openvino: Update to OV 2026.2.1, self-contained release packages, operator improvements (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24974">#24974</a>)</p> <ul> <li> <p>Update to OV 2026.2.1, Make OV release packages s…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 16:50
<details open=""> <p>sync : ggml</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b9816/llama-b9816-bin-macos-arm64.tar.gz">macOS Apple Silicon (arm64)</a></li> <li>macOS Apple Silicon (arm64, KleidiAI ena…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 16:16
<details open=""> <p>vulkan: opt mul_mat_vecq for mi50 (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/22933">#22933</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/downl…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 15:40
<details open=""> <p>vulkan: add INTEL_XE1 arch enum and enable coopmat1 on Intel Xe-LPG Plus (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24404">#24404</a>)</p> <ul> <li>vulkan: add INTEL_PRE_XE2 arch enum and enable coopmat1 on Intel Xe-…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 13:06
<details open=""> <p>vulkan: Workaround compiler bug in conv2d coopmat2 path (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/24924">#24924</a>)</p> <ul> <li> <p>vulkan: Workaround compiler bug in conv2d coopmat2 path</p> </li> <li> <p>apply s…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 11:46
<details open=""> <p>CUDA: add cublasSgemmBatched mapping for HIP/MUSA vendor headers (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25033">#25033</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/gg…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 07:17
<details open=""> <p>mamba2: remove hardcoded 2x expansion factor and invalid d_inner % d_state check (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/23082">#23082</a>)</p> <ul> <li> <p>mamba2: remove hardcoded 2x expansion factor, support an…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-26 02:28
<details open=""> <p>opencl: flush profiling batch at shutdown for incomplete batches (<a class="issue-link js-issue-link" href="https://github.com/ggml-org/llama.cpp/pull/25016">#25016</a>)</p> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/gg…
llama.cpp — Releases
TIER_1
(SO)
·
github-actions[bot]
·
2026-06-25 22:50
<details open=""> </details> <p><strong>macOS/iOS:</strong></p> <ul> <li><a href="https://github.com/ggml-org/llama.cpp/releases/download/b9802/llama-b9802-bin-macos-arm64.tar.gz">macOS Apple Silicon (arm64)</a></li> <li>macOS Apple Silicon (arm64, KleidiAI enabled) <a href="http…