研究人员推出了一种新颖的混合AI架构AMOR(自适应元认知输出路由器),该架构根据预测不确定性选择性地采用注意力机制。这种方法用熵门控注意力块增强了循环骨干网络,这些块仅在模型输出熵超过动态阈值时激活。在FineWeb-Edu数据集上进行测试,采用Mamba2或Gated DeltaNet骨干网络的AMOR变体,在常识推理得分上优于现有的循环、仅注意力以及固定调度的混合模型。该架构还展示了改进的检索性能,并保持了其循环组件的长上下文鲁棒性特征,在分布偏移下表现优于Transformer和其他混合模型。 AI
影响 这项研究表明,选择性注意力分配可以提高AI模型的效率和鲁棒性,可能影响未来的混合模型设计。
排序理由 详细介绍新AI模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →