实体
Zhongxiang Dai
Zhongxiang Dai
PulseAugur coverage of Zhongxiang Dai — every cluster mentioning Zhongxiang Dai across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新算法优化用于顺序决策的 LLM 提示
研究人员开发了一种名为 EXPO-ES 的新算法,用于自动优化用于顺序决策任务的大型语言模型(LLM)的元提示。该方法借鉴了对抗性赌博算法的思路,以处理该领域常见的非平稳奖励观察。EXPO-ES 算法可以优化元提示中的任务描述、元指令和交互历史,以提高 LLM 代理的性能,大量实验表明性能有显著提升。
-
新的T-POP方法通过实时用户反馈个性化LLM
研究人员开发了T-POP,一种使用在线偏好反馈实时个性化大型语言模型的新方法。该方法通过从用户交互中学习奖励函数而不更新LLM的参数来解决冷启动问题。T-POP采用对决学习算法来有效地平衡用户偏好的探索和所学知识的利用,在数据效率和个性化速度方面均显著优于现有方法。