llama.cpp 项目发布了 b11516 版本,该版本解决了整数到整数 (IM2COL) patch-embed 直接内存访问 (DMA) 环溢出问题。当系统尝试排队比环所能容纳的更多的 DMA 描述符时,就会发生此溢出,导致在计算中使用过时的数据。此修复方法是在环满时撤销最旧的描述符,这是一种在同一文件中的类似内核中已采用的方法,并确保正确刷新 DMA 队列。此更新对于 Qualcomm Hexagon 架构上某些切片配置(特别是 patch embedding 操作)的正确运行至关重要。 AI
影响 提高了特定硬件上 AI 模型推理的稳定性和准确性。
排序理由 这是 llama.cpp 项目中特定组件的错误修复,而不是新模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →