研究人员推出了一种名为“测试时训练与下一个词元预测”(TTT-NTP)的新方法,该方法可增强预训练长上下文语言模型的性能。该技术利用语言模型训练中使用的固有下一个词元预测信号,来指导测试时训练过程中的适应过程。与使用代理的先前方法不同,TTT-NTP直接使用模型自身的上下文隐藏状态来监督更新,确保每个适应步骤都与核心训练目标保持一致。在RULER Full-13和LongBench-v2等基准测试上的评估显示,包括Llama-3.1-8B和Mistral-7B-v0.3在内的各种模型在不损害现有能力的情况下,性能得到了一致提升。 AI
影响 该方法可以通过利用已部署LLM的核心训练目标来提高其适应性和性能。
排序理由 该集群包含一篇详细介绍语言模型适应新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Llama-3.1:8b
- LongBench-v2
- Mistral-7B-v0.3
- Qwen3 0.6B
- Qwen3-4B
- RULER Full-13
- Test-Time Training with Next-Token Prediction
- TTT-NTP
- Xuan Ouyang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →