Chains of thought
PulseAugur coverage of Chains of thought — every cluster mentioning Chains of thought across labs, papers, and developer communities, ranked by signal.
-
OpenAI 的 GPT-6 和 Mostik 的技术预示着 AI 正在摆脱基于 token 的模式
据报道,OpenAI 正在为其即将推出的 GPT-6 模型开发一种名为“循环深度”(recurrent depth)的新架构,旨在通过允许模型在内部循环和完善其思考过程,而不是生成冗长的基于文本的“思维链”(chains of thought),来改进推理能力。这种向内部、非文本计算的转变可能会显著改变人工智能行业的基于 token 的商业模式。与此同时,一家名为 Mostik 的俄罗斯初创公司展示了一种完全绕过人类语言的跨模型通信方…
-
新的LEMUR框架可从推理MLRM中移除敏感数据
研究人员开发了LEMUR,一个旨在从多模态大型推理模型(MLRM)中移除敏感信息的新颖框架。该方法在推理时运行,无需重新训练模型。LEMUR识别了训练后强化学习(RL)引入的隐私漏洞,这些漏洞可能导致敏感事实在模型的推理过程中泄露,即使它们不在最终答案中。通过利用RL引起的探索特有的令牌级熵签名,LEMUR重定向推理过程以净化这种泄露,同时保持模型的整体效用和流畅性。
-
SymDiag 框架通过神经符号验证诊断大语言模型推理失败
研究人员推出 SymDiag,一个新颖的神经符号框架,旨在诊断大语言模型(LLM)推理中的失败。与关注结果或主观批评的现有验证方法不同,SymDiag 将大语言模型的思维链(chains-of-thought)转化为符号约束,以查明具体的推理错误。该框架还包含一个自我审计器(Self-Auditor),用于区分真实的推理缺陷和翻译过程中引入的错误,从而提供可验证的失败证据。
-
新基准揭示LLM忠实度指标存在重大缺陷
一个名为BonaFide的新基准已被开发出来,用于评估用于评估大型语言模型推理的忠实度指标。该基准包含13个任务和10个模型的3,066个标记的思维链,揭示大多数现有的忠实度指标表现不佳,通常接近随机水平。这些指标还表现出偏差,并随着思维链的增长而退化,凸显了当前评估方法中的重大差距,以及对更可靠、更有效的替代方案的需求。