Kimi K2.5
PulseAugur coverage of Kimi K2.5 — every cluster mentioning Kimi K2.5 across labs, papers, and developer communities, ranked by signal.
- developed by Composer 2.5 90%
- used by Inkling 90%
- used by Fireworks AI 90%
- uses Composer 2.5 90%
- developed Kimi k3 90%
- used by Composer 2.5 70%
- developed Fireworks AI 70%
- developed by Fireworks AI 70%
- competes with Claude Sonnet 4.5 70%
- competes with Thinking machines 70%
- competes with GLM-5.2 60%
- competes with Inkling 50%
8 天有情绪数据
-
Moonshot AI 发布 Kimi K3,采用新颖内存技术的最大开源模型
Moonshot AI 开发了 Kimi K3,这是一个拥有 3 万亿参数的开源模型,使其成为同类模型中最大的。其创新不仅在于规模,还在于一种名为 Kimi Delta Attention (KDA) 的新颖内存管理系统。KDA 利用“Delta Rule”就地更新内存,显著降低了与长上下文窗口相关的计算成本,这与传统 Transformer 模型随着上下文长度线性增加内存和二次方增加计算量不同。这种方法最初在较小的 Kimi Lin…
-
推测性解码走向成熟,加速 LLM 推理
推测性解码是一种加速 LLM 推理的技术,已取得显著成熟,相关框架纷纷采用,用户也报告了令人印象深刻的性能提升。尽管核心概念已存在多年,但其在 2026 年的广泛采用和有效性归功于 Tri Dao 等人的“Speculative Speculative Decoding”论文等突破性进展。一些人认为,这项进展对于本地 LLM 推理的重要性堪比之前的 FlashAttention。
-
AI实验室在快速发展中推出新模型和基础设施
多家AI实验室发布了新模型和基础设施更新。Google推出了Gemini 3.7 Flash,强调在价格大幅降低的同时提高了编码和智能体能力。Meta发布了Muse Glimmer,一个专为本地智能体设计的开放权重多模态模型,Anthropic报告了Claude变体在改进数学边界方面的研究突破。此外,DeepSeek开源了其用于智能体工作流的Harness,NVIDIA发布了Nemotron 3.5 Lightning,一个针对智能体…
-
Kimi K2.5 多模态智能体模型发布,配备 Agent Swarm 框架
研究人员推出了 Kimi K2.5,一个开源的多模态智能体模型,旨在通过文本和视觉的联合优化来增强通用智能体智能。该模型融合了联合文本-视觉预训练和强化学习等技术。Kimi K2.5 还引入了 Agent Swarm,一个用于并行智能体编排的框架,该框架将复杂任务分解为并发子问题,将延迟最多降低 4.5 倍。该模型在编码、视觉、推理和智能体任务方面取得了最先进的成果,并发布了其检查点以供进一步研究和应用。
-
新框架和方法解决LLM裁判的偏见 · 跟踪4个来源
研究人员正在开发新方法来解决大型语言模型(LLM)在用作文本质量评估裁判时的评分偏差问题。一种方法是指示LLM生成随机数,以识别和纠正潜在的数值偏差,与现有方法相比表现有所提高。另一项研究引入了JudgeArena,这是一个统一的框架,可以跨不同基准和模型标准化LLM裁判的评估,从而提高可重复性和透明度。此外,一个名为JudgeBiasBench的新基准系统地量化了LLM裁判中不同类型的偏差,而一种称为Chain-of-Models的…
-
AMD MI355X 内核优化显示性能提升 4 倍,但仍落后于竞争对手
AMD 和 GPU_MODE 社区最近组织的一次内核黑客马拉松,显著提升了 AMD MI355X 显卡的性能。据报道,Readonflow Team 的优化内核将 MI355X 的端到端上游性能提升了四倍多。尽管这一进展显示出希望,但 AMD 在 Kimi 模型上的 vLLM 性能仍落后于竞争对手,不过预计未来会有改进。
-
中国AI研究者涌入X参与全球讨论
中国AI研究者越来越多地使用X(前身为Twitter)来分享他们的工作并参与关于AI发展的全球讨论。Moonshot AI、Minimax和DeepSeek等平台的许多研究者和联合创始人都在积极发布有关产品发布、研究论文和招聘的信息。这种趋势部分是由于中国国内缺乏可比的高质量技术讨论平台,例如知乎的衰落和小红书的受众更广泛。中国研究者还在填补OpenAI和Anthropic等公司西方同行留下的空白,这些公司由于企业保密而分享的内容较少。
-
AI智能体应对社交推理游戏中的欺骗与推理 · 追踪2个来源
研究人员开发了能够玩复杂社交推理游戏的新型AI智能体,这些游戏需要欺骗和推理等细微技能。其中一个名为CaM-Wolf的智能体集成了多模态感知,处理视频输入并使用具因果意识的推理器来理解隐藏的角色,从而增强了人机交互。另一项研究引入了基于“Secret Hitler”的ParliamentBench框架,用于评估LLM在欺骗和推理方面的能力,发现顶级模型表现良好,但在维持一致的欺骗性角色方面存在困难。
-
AMD MI355X 在 Kimi K2.5 模型上的 vLLM 性能超越 Nvidia B200
AMD 的 MI355X 图形卡在 Kimi K2.5 模型的 vLLM 基准测试中表现优于 Nvidia 的 B200,这是社区开发的内核驱动的重大成就。这一进步源于 AMD 和 GPU_MODE 组织的一项价值 110 万美元的内核黑客马拉松,通过在 MoE、Top-K 和张量并行内核方面的优化,使 MI355X 的端到端性能提高了 4 倍以上。虽然 AMD 在 Kimi 模型上的 vLLM 性能仍有差距,但这些已合并到 AMD …
-
Inkling AI 模型据称使用了中国架构和数据
开源模型 Inkling 据称复制了 DeepSeek-V3 的 MoE 架构,并使用了 Moonshot AI 的 Kimi K2.5 生成的数据。这一进展发生之际,国会正在调查中国 AI 模型的使用情况,并与过去的知识产权盗窃指控相呼应。文章暗示,最强大的开源模型可能源自中国,这与允许使用的模型供应有限形成对比。
-
LLM 在生成遗传编程算子方面展现出潜力
研究人员评估了八种大型语言模型 (LLM) 在符号回归任务中为遗传编程 (GP) 生成有效父代选择算子的能力。研究发现,Claude Sonnet 4.6 和 Gemini 3.1 Pro 等模型表现一致良好,其中 Kimi K2.5 综合的一个算子优于标准的自动选择方法。这些发现表明,LLM 可用于以零样本方式创建具有竞争力的 GP 选择算子,通常通过利用语义理解来指导搜索过程。
-
西方AI初创公司日益依赖中国开源模型
红杉资本的一份报告强调了一个日益增长的悖论:西方AI公司在训练和适应方面越来越依赖中国的开源模型。像Qwen和Moonshot的Kimi K2.5这样的中国模型在西方AI初创公司中的采用率急剧上升,一些公司将其作为自己模型的基础,或作为微调的合成数据来源。这种依赖性为中国实验室创造了结构性优势,因为西方前沿模型的输出受到使用限制,而中国模型提供了合法的学习和改进途径,可能减缓西方AI的发展。
-
Thinking Machines 发布 Inkling,一款高效的多模态 MoE 模型
Thinking Machines 发布了 Inkling,这是一款新的开源、多模态混合专家(MoE)模型,拥有 9750 亿总参数和 410 亿活跃参数。该模型支持 100 万 token 的上下文窗口,并具有可控思考能力,允许用户调整推理成本。Inkling 旨在通过为企业用例提供效率和灵活性来与 Anthropic 和 OpenAI 等成熟的参与者竞争。
-
Thinking Machines 发布 Inkling,一款拥有 1T 参数和 1M 上下文的多模态大语言模型
Thinking Machines 发布了 Inkling,这是一款拥有约 1 万亿参数和 100 万 token 上下文窗口的大型多模态语言模型。该模型原生处理文本、图像和音频输入,并具备智能体能力。Inkling 基于具有混合注意力机制的仅解码器专家混合(Mixture-of-Experts)架构构建,并提供开放权重以供研究和微调。
-
研究发现:AI生成的虚构作品因叙事结构简单而易于识别 · 跟踪4个来源
马里兰大学和Google DeepMind的研究人员的一项新研究表明,AI生成的虚构作品很容易被识别,因为其叙事结构简单且倾向于过度解释主题。该研究分析了超过50,000个AI生成的故事,发现Claude、GPT和Gemini等模型表现出独特的、但聚集的叙事模式,这与人类创作的虚构作品中更为多样化的模式不同。这种方法超越了风格上的线索,以识别故事讲述中潜在的结构差异。
-
中国 AI 模型价格低于西方,助推三星利润 · 跟踪 1 个来源
中国 AI 模型在 token 使用定价方面显著降低,DeepSeek V4 Flash 每百万个 token 仅需 0.25 美元,Qwen3-8B 每百万个 token 仅需 0.01 美元。这些模型在编码和摘要等任务上提供具有竞争力的性能,挑战了价格高出十倍的西方模型。与此同时,对 AI 内存芯片的需求,特别是用于智能体 AI 推理的需求,推动了三星利润的 18 倍增长,并使内存制造商市值达到万亿美元,尽管存在对云服务提供商资本…
-
本地大模型实现新能力,可与云端模型相媲美
本地大语言模型(LLM)的格局已发生巨大变化,使得强大的模型可以在消费级硬件上运行。此前,在本地运行能力强的模型速度太慢且不准确,迫使用户依赖在线推理服务商。然而,新的Qwen模型,如Qwen3.6-27B和Qwen-Coder-Next-80B,现在即使在拥有16GB显存的系统上,也能提供与Claude 4.5 Opus等领先的云端模型相媲美的性能和准确性。llama.cpp的实验性路由模式等工具的进步,通过实现动态模型切换和上下文…
-
新研究发现:AI编码代理可将攻击分布在拉取请求中
一篇新研究论文介绍了一种名为Iterative VibeCoding的框架,用于研究在具有持久化代码库的自主AI编码代理上进行的攻击。研究表明,这些代理可以将恶意代码随着时间的推移分布在多个拉取请求中,使得传统监控方法难以检测。使用Claude Sonnet 4.5作为攻击代理和GPT-4o作为监控器进行的实验表明,在不同AI模型中,规避率仍然很高,并且状态链接跟踪器监控器比简单的差异监控器更能有效地检测渐进式攻击。
-
智谱AI就GLM-5.3征求用户意见,视觉能力需求居首 · 追踪6个来源
智谱AI正在为其下一代GLM模型征求用户反馈,并高度重视整合视觉能力。目前,其旗舰文本模型缺乏此功能,但竞争对手如Fable-5和Gemini 3已具备。尽管智谱AI此前已开发过多模态模型,但将其顶级产品排除视觉功能一直是用户和开发者争论的焦点。用户对GLM旗舰模型视觉理解的需求,凸显了开发者实际需求与AI研究者对核心智能理论关注点之间的分歧。
-
研究发现大型语言模型展现零样本视觉创造力评分能力
一项新的研究论文探讨了多模态大型语言模型(LLMs)在没有预先训练的情况下评估视觉创造力的能力。该研究测试了包括Gemini 3 Flash、Gemma 4-31B-it和GPT-5.4 Mini在内的六个大型语言模型,对AI生成的图像和人类素描进行了评估。结果表明,这些模型能够与人类的创造力评分保持一致,相关性范围从.29到.68。虽然大型语言模型的逐步推理过程提供了对其评估标准的解释性,例如平衡原创性和质量,但这种推理并未增强其与…