研究人员引入了新的方法和基准来改进全模态大型语言模型中的视听联合推理。OmniReasoning 项目开发了 OmniReasoningBench,这是一个基准和数据引擎,旨在明确测试模型同时使用音频和视觉信息进行推理的能力。他们提出的模态因子自蒸馏 (MFSD) 方法,当应用于 OmniReasoning-30B-A3B 模型时,显著提高了视听推理任务的性能。另外,OP-CAD 框架通过使用具有选择性 token 监督的 on-policy 蒸馏,专注于增强这些模型在环境噪声和竞争语音下的鲁棒性,在各种噪声条件下均表现出性能提升。 AI
影响 这些进展可能带来更强大、更具能力的通用模态人工智能系统,提高它们在真实、嘈杂环境中的性能。
排序理由 该集群包含两篇 arXiv 论文,详细介绍了大型语言模型中视听推理的新方法和基准。
- Hugging Face
- Modality-Factored Self-Distillation
- OmniQA
- OmniReasoning
- OmniReasoning-30B-A3B
- OmniReasoningBench
- OmniReasoning-RL-19K
- OmniReasoning-SFT-112K
- OmniVideoBench
- On-Policy Clean-Audio Distillation
- OP-CAD
- Qwen3-Omni-30B-A3B-Thinking
- Video-MME-v2
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →