PulseAugur
中
实时 19:57:10
实体 Chains of thought

Chains of thought

PulseAugur coverage of Chains of thought — every cluster mentioning Chains of thought across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. SIGNIFICANT · CL_234345 ·

    OpenAI 的 GPT-6 和 Mostik 的技术预示着 AI 正在摆脱基于 token 的模式

    据报道,OpenAI 正在为其即将推出的 GPT-6 模型开发一种名为“循环深度”(recurrent depth)的新架构,旨在通过允许模型在内部循环和完善其思考过程,而不是生成冗长的基于文本的“思维链”(chains of thought),来改进推理能力。这种向内部、非文本计算的转变可能会显著改变人工智能行业的基于 token 的商业模式。与此同时,一家名为 Mostik 的俄罗斯初创公司展示了一种完全绕过人类语言的跨模型通信方…

  2. TOOL · CL_198166 ·

    新的LEMUR框架可从推理MLRM中移除敏感数据

    研究人员开发了LEMUR,一个旨在从多模态大型推理模型(MLRM)中移除敏感信息的新颖框架。该方法在推理时运行,无需重新训练模型。LEMUR识别了训练后强化学习(RL)引入的隐私漏洞,这些漏洞可能导致敏感事实在模型的推理过程中泄露,即使它们不在最终答案中。通过利用RL引起的探索特有的令牌级熵签名,LEMUR重定向推理过程以净化这种泄露,同时保持模型的整体效用和流畅性。

  3. RESEARCH · CL_193353 ·

    SymDiag 框架通过神经符号验证诊断大语言模型推理失败

    研究人员推出 SymDiag,一个新颖的神经符号框架,旨在诊断大语言模型(LLM)推理中的失败。与关注结果或主观批评的现有验证方法不同,SymDiag 将大语言模型的思维链(chains-of-thought)转化为符号约束,以查明具体的推理错误。该框架还包含一个自我审计器(Self-Auditor),用于区分真实的推理缺陷和翻译过程中引入的错误,从而提供可验证的失败证据。

  4. RESEARCH · CL_51253 ·

    新基准揭示LLM忠实度指标存在重大缺陷

    一个名为BonaFide的新基准已被开发出来,用于评估用于评估大型语言模型推理的忠实度指标。该基准包含13个任务和10个模型的3,066个标记的思维链,揭示大多数现有的忠实度指标表现不佳,通常接近随机水平。这些指标还表现出偏差,并随着思维链的增长而退化,凸显了当前评估方法中的重大差距,以及对更可靠、更有效的替代方案的需求。