一篇新研究论文探讨了矩阵值连续思维链模型中的秩不敏感性概念,特别是在 ProsQA 数据集上。研究发现,将潜在矩阵 Z 投影到较低秩并未显著影响模型的准确性,这表明秩并未如假设的那样有效地捕捉并行推理路径。对各种读出方法和 vanilla GPT-2 的对照进行的进一步实验证实,秩消融方法本身可能将秩盲目性与位置无关性混淆了。 AI
影响 探讨了当前连续思维链模型的一个潜在局限性,为架构研究开辟了新途径。
排序理由 学术论文,详细介绍了模型架构和行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →