研究人员推出 TiTok,这是一种视听大语言模型,旨在精确识别未修剪视频中的多个时间事件片段。该模型采用新颖的时间令牌交织(TTI)方法,通过将特殊时间令牌集成到视听流中来增强边界预测。为解决计数校准不准的问题,TiTok 采用了解耦奖励系统,并使用组奖励-解耦归一化策略优化(GDPO)进行优化,在新评估协议上取得了 65.7 mIoU 和 0.58 CountF1 的最先进成果。 AI
影响 引入了一种新颖的视听时间定位方法,有望改进视频分析和内容检索系统。
排序理由 详细介绍新模型和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CountF1
- Group reward-Decoupled Normalization Policy Optimization
- Hugging Face
- Time Token Interleaving
- UnAV-100
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →