一篇新发表在arXiv上的研究论文探讨了训练后AI模型如何会失去适应上下文信息的能力,尤其是在针对特定观点进行微调时。研究发现,虽然模型在训练后会更主导地表达偏好的观点,但它们理解和表达相反观点的能力会减弱。研究人员提出了一种名为“立场分布匹配”的替代目标,以解决强制特定价值观与保持多样化用户需求的可控性之间的矛盾。 AI
影响 这项研究突显了在使AI模型与多样化用户价值观保持一致方面的一个关键挑战,并提出了在不牺牲表述广度的情况下提高可控性的潜在方法。
排序理由 该集群包含一篇详细介绍AI模型行为研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AI models
- arXiv
- Hugging Face
- in-context information
- large-language models
- Post-Training
- stance-distribution matching
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →