研究人员开发了一种新颖的两阶段多模态灾害严重性评估训练框架,该框架整合了监督微调(SFT)和直接偏好优化(DPO)。该方法利用统一的数据构建流程生成两个数据集:用于SFT的ReasoningSet和用于DPO对齐的PreferenceSet。实验表明,在分类准确性和解释质量方面均有显著改进,后续的DPO对齐进一步增强了可解释性。通过在InternVL-3-8B和LLaVA-1.5-7B上的跨模型验证,证明了该框架的鲁棒性,从而能更好地检测代表性不足的损坏案例,并使模型推理与人类判断更加一致。 AI
影响 增强了人工智能系统在灾害管理等关键应用中的可靠性和可解释性。
排序理由 该集群包含一篇详细介绍新方法和实验结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- InternVL-3-8B
- LLaVA-1.5-7B
- PreferenceSet
- ReasoningSet
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →