研究人员开发了SERUM,一个新颖的框架,通过分层视觉语言模型注释,从非结构化屏幕活动中提取和精炼有限状态行为模型。该多通道系统在活动识别和意图推断之间交替进行,以提高标签准确性并减少幻觉。SERUM已证明其能够从以自我为中心的屏幕视频中创建可解释的过程模型,而无需手动注释,这为可扩展的用户建模和行为理解带来了希望。 AI
影响 能够从非结构化屏幕数据中实现可扩展的用户建模和行为理解。
排序理由 该项目是一篇研究论文,详细介绍了用户建模的新框架和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Markov models
- optimization
- ScienceCast
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →