普林斯顿大学的研究员Yifan Zhang提出了一种名为循环循环Transformer (RLT) 的新颖架构。该设计旨在通过将包括最终隐藏状态和分层注意力缓存的完整状态从一个Token传递到下一个Token,来增强仅解码器语言模型的时间深度。RLT架构包含一个因果编码器和一个循环解码器,每个Token的处理涉及96个逻辑块。虽然该设计规定了具有无限时间深度的潜在推理、模型-硬件协同设计和模型-RL算法协同设计的原则,但目前缺乏效率、推理质量或扩展性方面的实测结果。 AI
影响 这项架构提案有可能使语言模型能够保持更长序列的上下文,从而提高它们处理复杂、多轮对话或长文档的能力。
排序理由 该项目描述了一个语言模型的拟议研究架构,详细说明了其设计原则和组件,但没有提供实证结果或正式发布。[lever_c_从研究降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →