实体
Context Distillation
Context Distillation
PulseAugur coverage of Context Distillation — every cluster mentioning Context Distillation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的“LLM-as-a-Coach”方法增强了复杂任务的强化学习
研究人员推出了一种新颖的强化学习方法“LLM-as-a-Coach”,用于难以客观验证的任务。该方法将LLM-as-a-Judge系统的反馈机制重新用于LLM-as-a-Coach。该教练将丰富的文本反馈提炼成“经验知识”,然后用于条件化教师模型,并通过上下文蒸馏来改进策略。与传统的标量奖励相比,这种高带宽反馈通道提供了更密集的监督,并更好地保留了高质量响应中的细微偏好。
-
新研究解决LLM长上下文和可靠性记忆问题
多篇研究论文探索了增强大型语言模型(LLM)记忆系统以处理长上下文和提高可靠性的新方法。这些方法包括使用测试时梯度下降将上下文写入内存、将上下文蒸馏到模块化适配器中,以及开发全面的内存基础管理系统。研究人员还专注于调试和归因这些记忆系统中的错误,提出基准和框架来识别故障模式并提高性能。