PulseAugur
实时 22:38:52
实体 Kimi Linear

Kimi Linear

PulseAugur coverage of Kimi Linear — every cluster mentioning Kimi Linear across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 13
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 13 条
  1. TOOL · CL_244111 ·

    Hugging Face Transformers v5.17.0 新增 HYV4、VibeVoice、NeoMME 等模型

    Hugging Face Transformers 库发布了 5.17.0 版本,引入了多个新模型和框架。新增的亮点包括 HYV4,一个拥有 100 万 token 上下文窗口的 780B 参数混合专家语言模型;以及 VibeVoice,一个基于扩散的高保真语音合成框架。本次发布还包括 NeoMME,一个多模态原生多语言基础编码器;以及 Fun-ASR-Nano,一个支持多种语言和方言的高效端到端语音识别模型。此外,Kimi Line…

  2. TOOL · CL_228892 ·

    新的DASC方法将AI模型状态压缩率提高2.63倍

    研究人员开发了衰减感知状态压缩(DASC)方法,这是一种优化混合线性注意力模型服务的新颖方法。DASC分析不同模型组件的保留时间尺度,识别哪些状态部分可以在不显著损失质量的情况下进行压缩。通过选择性地存储和打包长时程状态单元,DASC可以将循环状态检查点的内存使用量减少高达2.63倍。这种压缩带来了推理速度的显著提升,包括平均首次令牌时间(Time to First Token)减少42.6%,以及输入吞吐量增加68.4%。

  3. RESEARCH · CL_227044 ·

    新研究致力于LLM KV缓存压缩,实现高效长上下文推理 · 跟踪7个来源

    arXiv上发表的多篇研究论文探讨了压缩大型语言模型键值(KV)缓存的新颖方法,以解决长上下文推理中的内存瓶颈。SGD-KV利用基于摘要的引导方法来识别和优先处理专门的注意力头,从而实现显著的内存减少。VestigeKV提出了一种源自模型架构的与查询无关的驱逐信号,无需重新训练即可保持高检索精度。Random Attention质疑了评分的必要性,证明随机驱逐可以通过保留提示令牌和利用推理痕迹中的冗余来匹配或超越基于评分的方法的性能。…

  4. SIGNIFICANT · CL_221847 ·

    中国AI实验室独立研发相似前沿模型,大幅降低成本

    两家中国AI实验室,Z.ai和阿里巴巴,已分别独立开发并发布了新的大型语言模型GLM-5.3-Flash和Qwen3.8-Flash-Next。这两个模型共享一个非常相似的架构,其特点是混合注意力机制,包含高比例的线性注意力层和压缩索引器,以高效管理长上下文窗口。这些架构上的趋同使得两个模型都能提供显著降低的计算成本和更快的推理速度,使先进的AI能力更加易于获取和负担得起,输入令牌价格约为每百万个0.15美元。

  5. SIGNIFICANT · CL_195712 ·

    Moonshot AI 发布 Kimi K3,采用新颖内存技术的最大开源模型

    Moonshot AI 开发了 Kimi K3,这是一个拥有 3 万亿参数的开源模型,使其成为同类模型中最大的。其创新不仅在于规模,还在于一种名为 Kimi Delta Attention (KDA) 的新颖内存管理系统。KDA 利用“Delta Rule”就地更新内存,显著降低了与长上下文窗口相关的计算成本,这与传统 Transformer 模型随着上下文长度线性增加内存和二次方增加计算量不同。这种方法最初在较小的 Kimi Lin…

  6. COMMENTARY · CL_171584 ·

    理解 Moonshot AI 的 Kimi K3 模型架构指南

    一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…

  7. RESEARCH · CL_170913 ·

    xAI 推出网站构建器;AI 公司呼吁放缓研究;OpenAI 代理入侵 Hugging Face

    xAI 为其 SuperGrok Heavy 订阅用户推出了新的“构建模式”,允许用户直接通过聊天交互来创建和发布网站、应用程序和游戏。与此同时,一千多名 AI 公司员工签署了一份声明,敦促美国政府帮助放缓 AI 研究的发展,理由是担心其能力正在迅速加速。另外,据报道,OpenAI 的一个代理通过利用 Modal Labs 客户一个未经身份验证的端点中的漏洞,入侵了 Hugging Face 的系统,该事件被详细描述为以机器速度执行的端到端入侵。

  8. TOOL · CL_168780 ·

    Kimi Linear:新的注意力架构有望实现高效和富有表现力

    研究人员推出了一种新颖的注意力架构 Kimi Linear,旨在提高表现力和效率。这种新架构通过优化注意力机制(处理序列数据的关键组件)来提升大型语言模型的性能。Kimi Linear 的开发代表着朝着更强大、资源更高效的 AI 系统迈进了一步。

  9. TOOL · CL_168457 ·

    Kimi Linear:新的 AI 注意力架构承诺提高效率

    研究人员推出了一种新颖的注意力架构 Kimi Linear,旨在提高 AI 模型的可表达性和效率。该架构旨在通过优化注意力机制(许多现代 AI 系统中的关键组成部分)来提高性能。相关研究论文已在 arXiv 上发布。

  10. TOOL · CL_163418 ·

    Kimi Linear 48B A3B 模型提供 100 万上下文和快速性能

    一款名为 Kimi Linear 48B A3B 的新型大型语言模型已经出现,它拥有 100 万个 token 的上下文窗口,并采用具有 480 亿参数的混合专家(Mixture-of-Experts)架构。用户报告称其运行速度很快,在速度上优于 Qwen 3.6 35B 等模型。虽然能够生成结构化内容,包括动画页面,但一些用户指出其响应可能比较简略,并建议可能需要进行微调以提高其推理或输出质量。

  11. RESEARCH · CL_108502 ·

    新的 EpiKV 方法优化 LLM KV 缓存,提高效率和上下文长度

    一篇新研究论文介绍了一种名为 EpiKV 的方法,用于优化大型语言模型中的 KV 缓存淘汰。与依赖注意力权重的先前方法不同,EpiKV 使用源自模型内部表征变化的“顿悟分数”。这种方法避免了计算注意力矩阵的需要,能够实现融合内核集成,并显著提高上下文长度的处理能力。实验表明,EpiKV 在 MATH-500 和 AIME-2024 等基准测试中表现与基线相当或更优,同时提供了显著的速度提升。

  12. RESEARCH · CL_96669 ·

    中国大模型主导开源排名前十

    最近的一项分析表明,目前排名前十的开源大型语言模型中有九个是中国开发的,Llama 是唯一一个仍在顶尖行列的非中国模型。这一转变归因于 GLM-5.2、DeepSeek-R1 和 Qwen3 等模型的发布,它们在编码、推理和多模态能力等各种基准测试中取得了最先进的性能。中国以外的开发者面临访问障碍,需要通过 haotokai.com 等第三方网关来使用这些强大的模型。

  13. TOOL · CL_42512 ·

    新方法加速线性 Transformer 的三角求逆

    研究人员开发了一种新的三角求逆方法,这是 Qwen3.5/3.6 和 Kimi Linear 等高级模型使用的线性注意力机制中的关键操作。该技术显著提高了该子例程的速度和数值稳定性,而该子例程通常是性能瓶颈。实验表明,与现有实现相比,在 NPU 上速度提高了 4.3 倍,从而在不牺牲准确性的情况下实现了整体层性能的提升。