实体
Kimi-Linear-48B
Kimi-Linear-48B
PulseAugur coverage of Kimi-Linear-48B — every cluster mentioning Kimi-Linear-48B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
DAMP新技术大幅降低LLM内存使用并提升速度
研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…
-
llama.cpp b10448 为本地推理添加 Kimi-K3 模型支持
llama.cpp 的最新版本 b10448 现在完全支持 Kimi-K3 文本模型。此次集成允许用户在本地硬件上运行 Kimi-K3 的高级混合注意力机制,该机制将 KDA 和 MLA 组件与跨层残差注意力相结合。这一扩展使专注于本地 LLM 推理和在 NVIDIA、AMD 和 Intel Arc 等消费级 GPU 上对不同模型架构进行基准测试的个人和组织受益。