研究人员推出OmniReasoner,一个旨在增强全模态大型语言模型(LLM)处理长音频视频内容能力的创新框架。该框架使LLM能够智能地决定何时以及何地使用“放大镜”工具,对音频视频流中的特定时间间隔进行更高保真度的检查。为了解决在没有大量手动标注的情况下训练这种工具使用行为的挑战,开发了一个时间增强数据引擎来合成训练轨迹。在各种基准测试上的实验表明,OmniReasoner在提高答案准确性和时间定位能力的同时,通过将高保真处理集中在相关片段上来优化计算资源。 AI
影响 增强了LLM分析复杂、长篇音频视频数据的能力。
排序理由 该集群包含一篇详细介绍LLM新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- OmniReasoner
- ScienceCast
- Temporal Augmented Data Engine
- TimeAnchor
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →