研究人员推出了一种名为双维度一致性(DDC)的新型框架,旨在优化大语言模型(LLMs)的推理过程。DDC通过整合路径质量与自适应终止来解决计算预算与推理质量之间的平衡挑战。该方法采用置信度加权贝叶斯协议和趋势感知分层剪枝,将资源集中于高质量的推理路径,从而减少幻觉并加速共识。初步评估表明,与现有方法相比,DDC在各种大语言模型上可以将令牌消耗减少十倍以上,同时保持或提高准确性。 AI
影响 这项研究通过在不牺牲准确性的情况下减少令牌消耗,有望实现更高效的大语言模型部署。
排序理由 这是一篇详细介绍优化大语言模型推理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Confidence-Weighted Bayesian protocol
- Dual-Dimensional Consistency
- Hang Yan
- Hugging Face
- large-language models
- Trend-Aware Stratified Pruning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →