研究人员开发了两种新方法,使语言模型能够执行“任意顺序推理”,这对于代码生成等任务至关重要,在这些任务中,用户可以在高级概念和具体细节之间流畅切换。第一种方法是基于 FlexMDM 的插入式掩码扩散,它通过启用插入来允许模型生成非连续区域的内容。第二种方法是潜在空间掩码扩散,它将预测转移到更粗粒度的语义片段,从而促进对不同生成顺序的搜索。这两种技术在经验测试中都显示出下游性能的提高,其中一个 7B FlexMDM 针对 Python 编码进行了训练,一个 125M LatentMDM 针对 GSM8K 任务进行了训练。 AI
影响 增强了语言模型在代码生成等复杂推理任务中的能力,有可能提高专业人工智能应用的性能。
排序理由 该项目是一篇学术论文,详细介绍了改进语言模型推理能力的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- FlexMDM
- Gotit.pub
- GSM8K
- Hugging Face
- IArxiv
- Influence Flower
- Kim et al. reply
- LatentMDM
- Python
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →