研究人员开发了DART,一种新颖的无训练混合推理模型框架。DART通过自适应地将查询路由到直接回答或扩展思考过程来优化token使用。该系统通过采样两个低成本草稿并进行比较来实现这一点;一致则直接回答,不一致则根据草稿熵触发预算预测。这种方法在不要求标记数据或梯度更新的情况下,在各种模型规模和家族中保持或提高了准确性,同时显著减少了token消耗,显示出前景。 AI
影响 该方法可以通过减少不必要的计算来提高AI模型的效率,从而可能降低成本并提高响应速度。
排序理由 该集群包含一篇详细介绍AI推理新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →