研究人员开发了StalePO,这是一种新的优化方法,旨在改进在过时偏好数据上训练的机器翻译系统。传统方法在使用旧模型的后编辑时,可能会降低性能或无法纠正特定错误。StalePO通过确保两个响应的似然度均向下移动,将策略锚定到其基础响应,并在令牌级别应用KL约束来解决此问题。这种方法已显示出显著的收益,在英译印地语翻译中将质量检查提高了多达14.9个百分点,在英译土耳其语翻译中提高了4.6个百分点。 AI
影响 通过有效利用遗留训练数据来提高机器翻译质量。
排序理由 该集群包含一篇详细介绍机器翻译新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- DagsHub
- Direct Preference Optimization
- English-to-Hindi
- English-to-Turkish
- Gotit.pub
- Hugging Face
- LLM-as-a-Judge
- ScienceCast
- South Marquesan
- StalePO
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →