PulseAugur
实时 07:12:37
English(EN) OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner框架使LLM能够分析长音频视频内容

研究人员推出OmniReasoner,一个旨在增强全模态大型语言模型(LLM)处理长音频视频内容能力的创新框架。该框架使LLM能够智能地决定何时以及何地使用“放大镜”工具,对音频视频流中的特定时间间隔进行更高保真度的检查。为了解决在没有大量手动标注的情况下训练这种工具使用行为的挑战,开发了一个时间增强数据引擎来合成训练轨迹。在各种基准测试上的实验表明,OmniReasoner在提高答案准确性和时间定位能力的同时,通过将高保真处理集中在相关片段上来优化计算资源。 AI

影响 增强了LLM分析复杂、长篇音频视频数据的能力。

排序理由 该集群包含一篇详细介绍LLM新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

OmniReasoner框架使LLM能够分析长音频视频内容

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen ·

    OmniReasoner: 通过原生工具使用处理长音频视频进行推理

    arXiv:2607.19339v1 Announce Type: new Abstract: Long audio-video reasoning is difficult for omnimodal LLMs because the decisive evidence is often sparse, cross-modal, and too expensive to preserve with uniformly high-fidelity inputs. We introduce OmniReasoner, a tool-use post-tra…