实体
Zhuchenyang Liu
Zhuchenyang Liu
PulseAugur coverage of Zhuchenyang Liu — every cluster mentioning Zhuchenyang Liu across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
NanoVDR将2B VLM蒸馏成69M文本编码器,用于更快的视觉文档检索
研究人员开发了NanoVDR,这是一种新颖的视觉文档检索方法,可显著降低计算成本。通过将一个大型的2B参数视觉-语言模型(VLM)蒸馏成一个参数量小得多的69M的纯文本编码器,NanoVDR实现了教师模型95.1%的质量,同时大幅降低了延迟和GPU需求。该方法将文档和查询的编码路径解耦,认识到查询通常是更简单的文本字符串,需要更少的复杂处理。
-
新基准测试视觉-语言模型在宜家组装说明上的表现
研究人员开发了IKEA-Bench,一个旨在评估视觉-语言模型(VLMs)在理解和对齐来自图示的组装说明与真实视频信息方面性能的新基准。该基准包含针对29种宜家家具产品的6种任务类型共1623个问题,研究表明,虽然文本说明可以被恢复,但它们可能会阻碍图示与视频之间的对齐。研究还发现,VLM架构家族比参数数量更能预测对齐准确性,并且视频理解仍然是一个重要的瓶颈。
-
新的剪枝方法大幅减小视觉文档检索模型尺寸
研究人员开发了一种新颖的无训练方法——结构锚点剪枝(SAP),用于压缩视觉文档检索模型。SAP通过识别和剪枝冗余的视觉标记来解决这些模型中多向量索引的显著存储开销问题,且无需依赖查询进行训练。该框架利用得分保留诊断和视觉入度中心性评分器,在保持高检索精度的同时有效减小了索引尺寸。