Kimi K2 Thinking
PulseAugur coverage of Kimi K2 Thinking — every cluster mentioning Kimi K2 Thinking across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI安全实验测试LLM在更大用户配置文件下对内存指令的遵循情况
一项AI安全实验探讨了用户配置文件的规模如何影响LLM对有关内存使用指令的遵循程度。该研究部分重现了PersistBench论文的发现,该论文研究了LLM的谄媚行为和相关个人信息的使用。通过将用户配置文件的规模加倍,并比较有和没有特定指令的模型响应,该实验旨在确定更大的配置文件是阻碍还是有助于模型遵循关于内存相关性的指令。
-
Claude Code 将 Kimi K2 Thinking 的输出混入响应中
一位用户报告了一个不同寻常的事件,Claude Code(特别是 Sonnet 5 模型)在其响应中意外地包含了来自 Kimi K2 Thinking 的输出。这发生在用户就一个副项目提问的会话期间。用户分享了混合输出的截图,并询问其他人是否遇到过类似的跨模型干扰。
-
研究发现,大型语言模型在删除代码方面存在困难,影响可维护性
一项新的研究论文指出了大型语言模型代码编辑能力中的“删除规避”问题,即模型倾向于保留应删除的代码。这种行为在 SWE-bench 基准测试中的领先模型中普遍存在,导致代码库更难维护。该研究引入了 CanItDelete 基准来专门测试删除任务,并发现即使是先进的模型也面临挑战,常常采用“守卫后撤”模式而不是直接删除。令人鼓舞的是,研究表明,使用以删除为重点的数据训练模型可以缓解这个问题并提高整体代码编辑性能。
-
AI安全研究推动模型取证以揭示意图
研究人员提倡加强对“模型取证”的关注,这是一个致力于调查令人担忧的AI行为根本原因的领域。核心思想是,仅仅观察到模型的一个负面行为不足以确定它是源于真正的失准还是良性的困惑。一篇新论文提出了模型取证的基线协议,包括分析模型的思维链并进行反事实实验来检验关于其动机的假设。这项研究旨在提供对AI行为更深入的理解,区分无意错误和故意颠覆,这对于制定有效的安全措施至关重要。
-
Nvidia Rubin GPU 承诺提供 10 倍更便宜的 Token,但存在重大隐忧
Nvidia 发布了其 Vera Rubin NVL72 GPU,承诺与 Blackwell 架构相比,每个 Token 的成本可降低高达 10 倍。然而,这种显著的成本节省取决于几个因素,包括使用新的 NVFP4 格式和特定的专家混合模型,并且基准测试是在完整机架规模下进行的。实际部署时间也带来了挑战,因为该硬件计划于 2026 年下半年发货,广泛可用性将延长至 2027 年,这可能与即时预算规划不符。
-
中国AI实验室发布前沿模型Qwen 3.5、GLM 5和MiniMax 2.5
多家中国AI实验室发布了新的旗舰开源模型,包括Qwen 3.5、GLM 5和MiniMax 2.5。这些发布标志着这些组织在AI发展前沿的重大推进。文章还介绍了一个名为相对采用指标(RAM)的新指标,用于跟踪模型在其各自规模类别内的下载和采用率。