研究人员推出了一种名为回合级多尺度密度比估计(Turn-level Multiscale Density Ratio Estimation, tlm-DRE)的新型大语言模型(LLM)训练后技术,旨在提升LLM在复杂、多回合智能体任务中的性能。与现有的通常关注单回合场景的对齐方法不同,tlm-DRE为不同回合分配不同的权重,并利用基于正负空间差异的非对称token级训练。在智能体基准测试上的实验表明,tlm-DRE在性能上可与传统的对齐方法相媲美,并使LLM能够在域内和域外条件下,在多回合推理任务中表现稳健。 AI
影响 这种新的训练方法有望提高LLM智能体在复杂、多回合推理任务中的稳健性和性能。
排序理由 该集群包含一篇详细介绍LLM智能体新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Dilma Rousseff
- Direct Preference Optimization
- Grpo
- large language model
- Proximal Policy Optimization
- tlm-DRE
- Turn-level Multiscale Density Ratio Estimation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →