Kimi K2.5
PulseAugur coverage of Kimi K2.5 — every cluster mentioning Kimi K2.5 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
推测性解码将 LLM 推理速度提升高达 5 倍
推测性解码是一种通过让一个更小、更快的模型一次草拟多个 token 来显著加快 LLM 推理速度的技术,然后由更大的模型一次性验证这些 token。这种方法在数学上是精确的,不会造成质量损失,根据草拟模型的准确性和草拟的 token 数量,可以实现 2 倍到 5 倍的速度提升。EAGLE 和原生多 token 预测 (MTP) 架构等进步正在不断提高草拟模型更准确地预测 token 的能力,从而进一步提高推理速度。
-
新基准揭示多模态大语言模型在视觉到代码复现方面存在困难
一个名为 FigCodeBench 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)复现复杂视觉图形和生成相应代码的能力。该框架通过整合视觉理解和代码生成,超越了孤立的评估,解决了当前基准的空白。在包括 Gemini-3.1 Pro 和 GPT-5.4 在内的 24 个专有和开源 MLLMs 上进行的实验,揭示了它们在各种编程语言和难度级别上的显著性能下降,为理解它们的局限性提供了见解。
-
量化对大型语言模型的影响:解释质量与压缩
dev.to 上最近的一篇讨论探讨了量化对大型语言模型的影响,特别是在 OpenCode Go 订阅服务的背景下。量化压缩模型权重以降低内存和计算需求,但其有效性因使用的方法和比特深度而异。虽然 Q8_0 和 Q5_K_M 等较高比特深度几乎保留了原始模型的所有质量,但 Q4_K_M,尤其是 Q2_K 等较低比特深度可能导致性能明显下降,这可能解释了用户对使用经过大量量化模型的服务的抱怨。
-
OpenAI定制Jalapeño AI芯片优先内部使用,暗示未来可能推出
OpenAI已开发出名为Jalapeño的定制AI推理ASIC,主要用于满足其日益增长的计算需求。虽然该芯片设计为可编程,能够运行OpenAI自身以外的各种模型,但公司目前的重点是满足内部需求。OpenAI已表示未来有可能向外部广泛推出,但供应链限制和内部需求目前优先。
-
Fortunate Recall 通过本体驱动策略增强LLM记忆管理
研究人员推出了一种新颖的策略层Fortunate Recall (FR),旨在改进大型语言模型 (LLM) 的记忆管理。FR通过将个人事实分类到行为本体中并应用特定类别的生命周期策略,解决了无界内存增长和检索精度下降的问题。该方法旨在根据记忆的行为类型,确定哪些记忆应该持久存在、被替换或调整其有效性。
-
Kimi K2 模型定价在不同平台间差异巨大,影响总成本
Moonshot 的 Kimi K2 模型定价在不同平台之间存在显著差异,同一模型变体的输出成本每百万 token 价格从 3.20 美元到 4.50 美元不等。这种价格差异是由于该模型通过多层渠道转售,每一层都会增加自己的利润。具体模型变体(例如,通用用途的 Kimi K2.6 与代码任务的 Kimi K2.7-code)和使用的平台等因素,都可能导致成本上的巨大差异。此外,对于重复使用上下文的工作负载至关重要的缓存输入 token…
-
Moonshot AI 的 Kimi API 速率限制怪癖解析
Moonshot AI 的 Kimi API 有一个独特的速率限制机制,可能会意外耗尽用户的配额。与其他 API 不同,Kimi 根据输入提示的大小加上 `max_completion_tokens` 设置来计算速率限制的 token 数,而与实际输出长度无关。这可能导致用户即使实际生成的 token 量很少,但如果设置了非常高的 `max_completion_tokens` 值,也会很快达到限制。文章建议将 `max_comple…
-
新的VDiff-Bench基准揭示MLLMs在细微图像差异识别方面存在困难
引入了一个名为VDiff-Bench的新基准,用于评估多模态大型语言模型(MLLMs)在识别图像之间细微差异方面的能力。该基准揭示了当前MLLMs存在的显著弱点,特别是在检测低级视觉变化(如噪声和纹理变化)方面。虽然一些模型在语义变化方面表现良好,但它们在这些更精细的细节上的性能会显著下降,有些模型甚至在存在差异时也无法识别出来。VDiff-Bench旨在提供一个有针对性的诊断工具,以暴露这些在标准的单图像视觉-语言任务中不明显的局限性。
-
真实邮件测试揭示了廉价模型在格式上的LLM故障
一家使用AI生成冷邮件的公司发现,像DeepSeek V4 Flash、Gemini Flash Lite和GLM这样的廉价模型未能保持适当的邮件格式,特别是将段落折叠成一个大块。这个问题并未被标准基准或结构化输出模式检测到,导致邮件无法发送。该公司默认使用的GPT-5 Mini模型在此次真实测试中表现最佳,这凸显了超越基本准确性分数、具备强大结构化输出能力的重要性。
-
开发者使用 OpenRouter 聚合器导致 Kimi 模型 API 费用激增
一位开发者在构建编码助手时发现,使用 Moonshot AI 的 Kimi 模型聚合器 OpenRouter 导致 API 费用出乎意料地高。虽然通过单个 API 密钥方便地访问 Kimi K2.5、K2.6 和 K2.7 Code 等多个模型,但聚合器掩盖了按 token 计价的成本,这比预期的要昂贵,特别是对于涉及大量输入和输出的代码审查任务。开发者发现,在不同的聚合器平台上,相同的 Kimi 模型定价各不相同,最终构建了一个中间…
-
新的上下文编译架构提升了大型语言模型的上下文学习能力
研究人员推出了一种新的上下文编译架构 (CCA),旨在改进大型语言模型处理上下文学习 (ICL) 的方式。CCA 旨在解决当前模型在需要严格遵守上下文中提供的新规则和知识的任务中的脆弱性。通过将文本上下文编译为具有固定槽位的类型化中间表示,CCA 能够实现可执行的验证器和纠正循环,在 CL-bench 等基准测试中显著优于现有的长上下文策略。
-
新的 DVBench 基准测试评估 MLLM 在数据视频上的表现
研究人员推出 DVBench,这是一个旨在评估多模态大语言模型(MLLM)理解数据视频能力的新基准测试。这些视频结合了动态图表和叙事元素,这是现有评估未能充分涵盖的能力。DVBench 包含 300 个真实世界的数据视频和 1000 个问答对。在对九个 MLLM 的评估中,Gemini-3.1 Pro 展现了最高的整体性能,而 Kimi-k2.5 在开源模型中领先。研究还指出,开源模型的性能并不总是与参数量相关,并且叙事能力并不总是能…
-
MineBench 4.0 发布,新增社区画廊、iOS 应用和私有模型测试功能
MineBench 是一个用于评估 AI 模型生成 3D 结构能力的基准测试工具,现已发布 4.0 版本。此次更新包括一个社区画廊,供用户展示和点赞自定义提示,并引入了私有模型检查点的 A/B 测试。此外,MineBench 现已在 iOS App Store 上架。在有限的时间内,登录用户可以与 Google Deepmind 合作的 Gemini 3.7 Flash 无限次生成。
-
Kimi K2.5 在具有竞争力的定价下实现了强劲的基准分数
Kimi K2.5 在包括 GPQA、HLE、长上下文和 SciCode 在内的多个基准测试中取得了显著的性能。该模型在这些评估中的定价具有竞争力,每美元 30 个整数点。这些结果是独立测量和发布的。
-
新的PeakBench基准测试揭示AI代理因资源限制而执行失败
引入了一个名为PeakBench的新基准测试,用于评估AI代理的执行能力,超越了简单的规划准确性。该基准测试表明,代理可以识别可并行化的任务,但由于执行期间的资源限制而仍然失败。PeakBench将评估分为逻辑规划和物理调度,揭示即使依赖关系图准确,模型在遵守资源限制方面仍然存在困难,导致崩溃。对包括GPT-5和DeepSeek-V4-Flash在内的八种不同模型的测试表明,它们在逻辑规划和物理调度方面的表现各不相同,GPT-5在逻辑…
-
Anthropic 目标 30 万亿美元市场以进行 IPO,预示着人工智能的广泛经济影响力
据报道,Anthropic 正在为 IPO 做准备,并计划向投资者展示一个超过 30 万亿美元的总潜在市场 (TAM) 估计值。这一数字涵盖了人工智能模型可能执行的所有潜在工作,远远超过了 SpaceX 此前创纪录的说法。虽然 Anthropic 目前的收入可观,但要实现这一 TAM 需要巨大的增长,这表明人工智能有潜力渗透到经济的几乎所有领域。
-
据报道,OpenAI 的定制“Jalapeno”芯片在性能上超越 NVIDIA Blackwell
OpenAI 开发了一款定制人工智能芯片,代号为“Jalapeno”,据报道其在性能和效率上超越了英伟达最新的 Blackwell 架构。独立研究公司 SemiAnalysis 在 OpenAI 实验室测试了该芯片,发现尽管是第一代产品,但在延迟和吞吐量等关键指标上均优于 Blackwell。该芯片利用人工智能进行自身开发,AI 生成的代码为其性能提升做出了贡献。虽然 OpenAI 计划继续使用英伟达硬件进行训练,但这种内部芯片开发标…
-
OpenAI 发布用于推理工作负载的定制 Jalapeño ASIC
OpenAI 与 Broadcom 合作开发了名为 Jalapeño 的自研推理 ASIC。这款定制芯片旨在为 OpenAI 的推理工作负载提供最佳计算平台,专注于每瓦性能和低延迟。Jalapeño ASIC 旨在超越当前行业领导者如 NVIDIA 的 GB200 和 GB300,尤其是在多芯片操作的能效和降低延迟方面。
-
OpenAI 的 Jalapeño ASIC 基准测试显示性能优于英伟达 GPU
OpenAI 与 Broadcom 合作开发了自己的 700W 推理 ASIC,代号为 Jalapeño。OpenAI 发布的基准测试表明,Jalapeño 在每千瓦吞吐量和延迟方面优于英伟达的 GB200 和 GB300 GPU,特别是在 GPT-OSS 120B 和 Moonshot AI 的 Kimi K2.5 等开源模型上。该公司计划今年晚些时候在其自己的数据中心部署这些芯片,随着规模的扩大,可能会影响高带宽内存 (HBM) 供应链。
-
新研究优化长视频多模态大语言模型的视觉标记处理
研究人员正在探索优化多模态大语言模型(MLLMs)处理视觉信息的方法,尤其是在处理长视频方面。多篇论文介绍了用于选择、压缩和修剪视觉标记以提高效率和准确性的技术。一项研究强调,帧选择是最关键的因素,经典的算法如正交匹配追踪(Orthogonal Matching Pursuit)与新方法相比表现相当。其他方法则侧重于自适应标记化、基于注意力熵的秩保持修剪以及为持续学习动态生成标记。