PulseAugur
实时 09:23:23
English(EN) Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

新方法将推理技能蒸馏到语言模型中,降低了代币成本

研究人员开发了一种方法,通过将知识蒸馏成紧凑的自然语言技能来提高语言模型中推理的效率。这种方法通过将现有轨迹中的共享过程编译成一种技能,然后将其注入到非推理模型的系统提示中,从而分摊了推理的成本,而推理通常需要 3-6 倍的输出代币。在四个代理基准测试中,该技术为 GPT-5.4-mini 恢复了 55%-100% 以上的推理差距,通常在显著减少代币使用量的同时,性能优于推理模式。 AI

影响 这项技术可以显著降低 AI 代理复杂推理任务的计算成本,使其更高效、更易于访问。

排序理由 这是一篇详细介绍一种改进语言模型效率的新颖方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法将推理技能蒸馏到语言模型中,降低了代币成本

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani ·

    广度而非深度:将推理溢价分摊到蒸馏技能中

    arXiv:2608.07885v1 Announce Type: new Abstract: Reasoning modes of language models outperform their non-reasoning counterparts on multi-step agentic tasks, but pay a 3-6x premium in output tokens on every episode -- much of it spent re-deriving procedures that are shared across e…