Attention Residuals
PulseAugur coverage of Attention Residuals — every cluster mentioning Attention Residuals across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Kimi K3模型通过新的注意力机制突破长上下文和深度瓶颈 · 已追踪2个来源
Moonshot的Kimi K3模型解决了极长上下文窗口和深度神经网络的挑战。为了处理长达一百万个token的上下文窗口,Kimi K3采用了Kimi Delta Attention (KDA),它将历史信息压缩成固定大小的状态,而不是像标准注意力那样存储单独的键值对。这种方法解决了序列长度增加带来的计算成本不断上升的问题。此外,该模型还引入了Attention Residuals,一种学习每一先前层贡献的机制,防止有用表示在模型深度中丢失。
-
理解 Moonshot AI 的 Kimi K3 模型架构指南
一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…
-
Together AI 与 Moonshot AI 合作托管 Kimi K3 模型
Together AI 和 Moonshot AI 已建立战略合作伙伴关系,Together AI 将成为 Moonshot 开源模型发布的主要平台。此次合作始于 Moonshot 的 Kimi K3 模型发布,该模型是一个拥有 2.8 万亿参数的稀疏专家混合模型,支持原生视觉功能,并拥有 100 万 token 的上下文窗口。该合作旨在通过 Together AI 强大的基础设施,包括模型后训练和生产级推理选项,让开发者能够立即获得…
-
Kimi K3 揭示长上下文和代理任务的架构创新
Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…
-
Moonshot AI的Kimi K3开源模型现已上线Telnyx API
Moonshot AI的Kimi K3是一个拥有2.8万亿参数的开源模型,现已可通过Telnyx推理API访问。该模型拥有100万token的上下文窗口、原生视觉能力和可配置的推理能力。Kimi K3表明,在编码和代理工作流等领域,开源模型正迅速接近Anthropic和OpenAI等竞争对手的闭源前沿模型。
-
Moonshot 发布 Kimi K3,一款拥有 2.8T 参数的多模态模型,支持 100 万上下文
Moonshot 发布了 Kimi K3,这是一款新的 2.8 万亿参数多模态模型,拥有 100 万 token 的上下文窗口和原生视觉能力。该模型在发布时展现出惊人的速度,达到每秒 460 token。Kimi K3 基于混合专家架构构建,并通过 Modal 平台提供,提供基于 token 的定价和专用容量选项。
-
双重注意力残差通过跨流交互增强Transformer模型
研究人员引入了双重注意力残差(DAR),这是一种旨在通过实现多个残差路径之间的交互来增强Transformer模型的新型架构。与先前孤立研究历史检索和多流方法不同,DAR允许这些流相互影响彼此的深度选择。这是通过相互的跨流寻址实现的,其中每个流的深度权重都根据另一流的状态进行计算,并应用于其自身的历史值。在从0.1B到7B参数的模型上进行的实验表明,与标准的残差Transformer和注意力残差相比,DAR始终能改善验证损失,分析表明…
-
Moonshot AI 的 Kimi K3 参数量达 2.8T,接近前沿性能 · 跟踪 1 个来源
Moonshot AI 发布了 Kimi K3,这是一款接近领先闭源模型性能的新前沿模型。K3 拥有 2.8 万亿参数、一百万 token 的上下文窗口以及混合专家(Mixture-of-Experts)架构。虽然在某些基准测试中落后于 Claude Fable 5 和 GPT-5.6 Sol 等顶级模型,但它在智能体任务和编码方面表现强劲,并且其每个 token 的成本远低于其前代模型。该模型目前可通过 API 和 Kimi 的产品…
-
Moonshot AI发布2.8T参数Kimi K3模型,支持1M上下文窗口
Moonshot AI发布了Kimi K3,这是一款拥有2.8万亿参数、具备Kimi Delta Attention和Attention Residuals的模型。该模型原生支持视觉理解,并拥有100万token的上下文窗口,是同等规模下首个开源模型。Kimi K3专为长篇编程、知识工作和复杂推理等高级应用而设计。
-
月之暗面发布Kimi K3,全球首个3T参数开源模型
月之暗面(Moonshot AI)已正式发布Kimi K3,这是一个拥有2.8万亿参数的开源模型。该模型采用了Kimi Delta Attention和Attention Residuals技术,原生支持视觉理解,并拥有100万token的上下文窗口。Kimi K3专为长文本编程和推理等高级智能场景设计,被定位为全球首个3万亿参数级别的开源模型。
-
Moonshot AI 发布 Kimi K3,以开放权重挑战前沿 AI 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开放权重模型,拥有 100 万 token 的上下文窗口,使其成为前沿 AI 领域的有力竞争者。虽然基准测试表明 Kimi K3 的表现非常出色,尤其是在编码和代理任务方面,但一些分析表明它可能仍落后于领先的专有模型数月。该模型的发布预计将降低 AI 服务的成本,并为公司带来新的地缘政治和商业战略考量。
-
Delta Attention Residuals 改进神经网络路由和性能
研究人员推出了一种新颖的神经网络残差连接升级方法——Delta Attention Residuals,它改进了跨层路由。该方法通过隐藏状态的差值而非累积状态本身进行路由,有助于防止深层网络的路由崩溃。该技术已在各种模型规模上持续提高困惑度,并且可以通过对预训练模型进行最小参数开销的即插即用微调来应用。
-
新的多门残差架构在无通信开销的情况下稳定激活
研究人员推出了一种新颖的架构——多门残差(MGR),旨在稳定深度残差层中的激活尺度,而无需像注意力残差那样产生通信开销。MGR采用评分和门控机制来管理多流上下文,并使用注意力池化来提取隐藏状态。所提出的方法已被证明适用于大规模训练和部署,并在现有架构上展现出性能提升。
-
Moonshot AI 推出 Attention Residuals 以实现高效 Transformer 扩展
Moonshot AI 推出了一种名为 Attention Residuals 的新架构技术,旨在提高 Transformer 模型的效率。这项创新用一种面向深度的(depth-focused)方法取代了传统的固定残差连接,有望为大型语言模型提供更好的扩展能力。该开发被定位为 Transformer 架构的重大进步,可能彻底改变 LLM 的性能。