研究人员推出了一种新颖的解码器-解码器架构Dolphin,旨在实现设备端语言模型中长上下文的高效处理。该方法使用一个较小的解码器将广泛的上下文提炼成内存嵌入,从而缩短主解码器的输入长度。通过将长文本视为一种独特的模态,类似于图像嵌入,Dolphin在不影响响应质量的情况下,实现了十倍的能效提升和五倍的延迟降低。该模型已在Hugging Face上公开可用,旨在在资源受限的环境中实现更复杂的AI能力。 AI
影响 通过提高长上下文处理的能效和降低延迟,在边缘设备上实现更复杂的AI能力。
排序理由 该集群包含一篇详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →