Kimi Delta Attention
PulseAugur coverage of Kimi Delta Attention — every cluster mentioning Kimi Delta Attention across labs, papers, and developer communities, ranked by signal.
- uses Kimi k3 95%
- developed by Kimi k3 95%
- developed Kimi k3 90%
- used by Kimi k3 90%
- used by Attention Residuals 90%
- developed by Attention Residuals 90%
- developed Opus 4.8 90%
- developed by Kimi Linear 90%
- instance of Kimi k3 90%
- competes with GPT 5.6 "Sol" 80%
- affiliated with Attention Residuals 70%
- used by Gated DeltaNet 70%
3 天有情绪数据
Kimi Delta Attention to be integrated into other open-source models
The Kimi Delta Attention mechanism, highlighted in the new Kimi K3 model, is a novel technology that enhances long-context memory. Given its open-source nature and the increasing demand for efficient long-context handling, it is plausible that other open-source LLM developers will seek to integrate or adapt this attention mechanism into their own models.
Moonshot AI to release specific benchmarks comparing Kimi Delta Attention to other methods
The recent research on Semidirect Fourier Delta Attention (SFDA) generalizes Kimi Delta Attention and mentions formal stability and complexity bounds. Moonshot AI may release specific benchmarks or technical papers detailing the performance advantages of Kimi Delta Attention over other long-context attention mechanisms, especially in comparison to SFDA, to further validate its innovation.
Kimi K3's open-weight release date is July 27, 2026
Multiple sources indicate that Moonshot AI's Kimi K3 model, while available via API, is scheduled to release its full weights by July 27, 2026. This is a key date for the open-source community to gain direct access to and further experiment with this large-scale model.
-
复杂的KDA实现了线性注意力中的旋转,以进行高级状态跟踪
研究人员详细介绍了一种名为复杂KDA(CKDA)的新型线性注意力机制,该机制允许在内存更新中进行旋转,从而实现比以往线性模型更复杂的国家跟踪。该机制建立在Moonshot AI的Kimi Linear架构之上,使用带符号门和特定的更新参数来实现这些旋转,这对于计数和跟踪状态至关重要。这项发表在arXiv上的突破表明,CKDA可以表示复杂的有限群,显著增强了线性注意力模型的表达能力。
-
新研究提高了线性注意力的效率和性能
研究人员正在开发新方法来提高大型语言模型中线性注意力机制的效率和性能。一种方法,Switching Linear Attention (SwiLA),在保持固定大小的循环状态的同时增强了表示能力,与标准 softmax 注意力相比,取得了有竞争力的结果。另一项开发,LeapQuant,专注于线性注意力的精确循环状态量化,在推理中实现了显著的加速,且质量损失很小。此外,对线性注意力的理论分析表明,其循环状态通常具有低秩结构,这表明通过基…
-
Moonshot推出Kimi K3,拥有2.8万亿参数和100万上下文窗口
Moonshot 推出了其 Kimi K3 模型,这是一个拥有 2.8 万亿参数的混合专家模型,上下文窗口超过 100 万个 token。该模型采用了新的 Kimi Delta Attention 机制,结合了线性注意力和全注意力层以提高效率。虽然 Moonshot 发布了令人印象深刻的演示和供应商运行的基准测试,但文章强调了区分这些与客观可验证的结构事实和独立的第三方信号的重要性。
-
研究探讨百万级上下文语言模型中的注意力汇聚问题
一篇题为《新的注意力机制能否真正解决百万级上下文中的注意力汇聚问题?》的新研究论文,调查了注意力机制在长上下文语言模型中的有效性。该研究引入了一个名为SinkProbe的诊断套件,用于测量注意力汇聚、激活模式和位置回忆。研究结果表明,注意力汇聚的主要原因是训练目标而非架构,并且先前报道的一种门控机制在测试的大规模下未能重现其效果。
-
新的DASC方法将AI模型状态压缩率提高2.63倍
研究人员开发了衰减感知状态压缩(DASC)方法,这是一种优化混合线性注意力模型服务的新颖方法。DASC分析不同模型组件的保留时间尺度,识别哪些状态部分可以在不显著损失质量的情况下进行压缩。通过选择性地存储和打包长时程状态单元,DASC可以将循环状态检查点的内存使用量减少高达2.63倍。这种压缩带来了推理速度的显著提升,包括平均首次令牌时间(Time to First Token)减少42.6%,以及输入吞吐量增加68.4%。
-
DAMP新技术大幅降低LLM内存使用并提升速度
研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…
-
Moonshot 详细介绍 K3 模型在多模态和长上下文方面的集成训练
Moonshot 详细介绍了其 K3 模型的训练过程,强调仅有架构不足以支撑,必须配合恰当的训练。该公司在开发语言模型的同时,也并行开发了 K3 的视觉编码器 MoonViT-V2,使两者能够共同学习表征。这种集成方法与将视觉能力添加到已训练语言模型的方法形成对比。
-
Kimi K3模型通过新的注意力机制突破长上下文和深度瓶颈 · 已追踪2个来源
Moonshot的Kimi K3模型解决了极长上下文窗口和深度神经网络的挑战。为了处理长达一百万个token的上下文窗口,Kimi K3采用了Kimi Delta Attention (KDA),它将历史信息压缩成固定大小的状态,而不是像标准注意力那样存储单独的键值对。这种方法解决了序列长度增加带来的计算成本不断上升的问题。此外,该模型还引入了Attention Residuals,一种学习每一先前层贡献的机制,防止有用表示在模型深度中丢失。
-
CAKE框架协同设计编译器代理以促进GPU内核演进
研究人员开发了CAKE,一个新颖的协同设计框架,它整合了编译器技术和AI代理以增强GPU内核演进。该系统允许代理编写一种称为CAKE IR的专业中间表示(IR),该IR详细说明了硬件调度、内存移动和同步。该框架旨在提高专家GPU内核的可复现性和性能,超越将编译器视为黑箱的局限性。早期结果显示,在NVIDIA GPU上,Flash-KMeans和Kimi Delta Attention等应用程序的速度显著提升,并有可能实现更广泛的内核泛化。
-
新的线性化注意力模型实现了更高的准确率和更低的困惑度
研究人员开发了一种 2-单纯复形注意力的线性化版本,将三线性分数重写为内积。这种新形式允许在序列长度上实现线性成本,同时保持全局覆盖范围,这与传统的窗口注意力机制不同。通过使用正随机特征近似求和并将过去的信息存储在固定大小的状态中,该方法可以使用自定义 Triton 内核实现,并与 Kimi Delta Attention 集成。最终的模型完全省略了 softmax 注意力,在 LAMBADA 等基准测试中展示了优越的下游准确率和更高的困惑度。
-
Moonshot发布开源2.8T Kimi K3模型,采用新颖的注意力机制
Moonshot的Kimi K3模型通过发布一个开源的2.8万亿参数模型,取得了重大里程碑,这一壮举此前仅在闭源系统中出现。尽管与OpenAI和Google等大型竞争对手相比面临资源限制,Moonshot通过Kimi Delta Attention (KDA)和AttnRes (Attention Residuals)等架构变革进行了创新。KDA优化了注意力机制,以降低长上下文的计算成本,而AttnRes通过学习如何选择性地整合来自前…
-
Moonshot AI 发布 Kimi K3,一款 2.8T 参数的开源 MoE 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开源专家混合(MoE)模型。该模型采用了 Kimi Delta Attention 等架构创新,提高了扩展效率,并在长时程编码和代理工作流等复杂任务上表现出色。模型权重以 MXFP4 格式在 Hugging Face 上提供,并详细介绍了如何使用 Amazon SageMaker HyperPod 和 Amazon EKS 在 AWS 上进行部署,这需要 …
-
理解 Moonshot AI 的 Kimi K3 模型架构指南
一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…
-
Alaya Token集成Kimi K3,全球首个3T开源模型
DataCanvas旗下的Alaya Token平台已集成Kimi K3,这是全球首个开源的3万亿参数模型。此次集成使用户能够通过Alaya Token的统一服务来访问Kimi K3的先进能力,包括其百万级token上下文窗口以及在编码和推理基准测试中的强大性能。该平台旨在提供可扩展的、按需的token计算能力,从而为企业应用实现各种领先的开源模型之间的无缝切换。
-
Together AI 与 Moonshot AI 合作托管 Kimi K3 模型
Together AI 和 Moonshot AI 已建立战略合作伙伴关系,Together AI 将成为 Moonshot 开源模型发布的主要平台。此次合作始于 Moonshot 的 Kimi K3 模型发布,该模型是一个拥有 2.8 万亿参数的稀疏专家混合模型,支持原生视觉功能,并拥有 100 万 token 的上下文窗口。该合作旨在通过 Together AI 强大的基础设施,包括模型后训练和生产级推理选项,让开发者能够立即获得…
-
Kimi Delta Attention 解析:从二次到线性变体
本文深入探讨了 Kimi Delta Attention (KDA) 机制,这是一种复杂的线性注意力变体。文章追溯了从二次注意力到 KDA 的演变过程,解释了 KDA 如何通过关注误差校正而非直接值更新来解决早期线性注意力模型的局限性。解释中使用了 bra-ket 符号和数学推导来说明该过程,并强调了其在 Qwen 和 Kimi 等现代模型中的应用。
-
AI被抓到谎称看到未见过的图像;探讨Kimi Delta Attention概念
一位研究人员演示了AI无法感知图像的能力,随后抓住了AI对其视觉输入的捏造。另外,一次讨论探讨了Kimi Delta Attention的概念,并暗示了其更广泛发展的潜力。
-
Kimi K3 揭示长上下文和代理任务的架构创新
Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…
-
Moonshot AI 发布开源 Kimi K3,用于复杂的编码任务 · 跟踪 2 个来源
Moonshot AI 发布了 Kimi K3,这是一个拥有 2.8 万亿参数的开源模型,专为长时程编码和代理任务而设计。该模型具有一百万个 token 的上下文窗口和混合专家(Mixture-of-Experts)架构,使其能够处理和理解庞大的代码库。虽然供应商报告的基准测试显示其编码性能具有竞争力,但其真正的价值在于其开源权重,允许团队将其集成到自己的工作流程中,并尝试自定义工具和系统。
-
新方法提升扩散 Transformer 的效率和性能 · 跟踪 4 个来源
研究人员开发了新方法来提高扩散 Transformer 的效率和性能,这是 AI 图像和视频生成的一个关键架构。Chimera,一种混合视觉扩散骨干网络,结合了不同的注意力机制和一种新颖的缩放方法,与传统模型相比,实现了显著的计算效率提升。此外,MMOE 通过借鉴大型语言模型的高效专家设计,实现了扩散 Transformer 的现代化,从而加快了收敛速度并改善了质量-成本平衡。Calibri 提供了一种参数高效的扩散 Transfor…