研究人员开发了 GazeDiT,这是一种新颖的扩散模型,旨在为眼动追踪训练数据生成高度精确的合成图像。该模型通过内部构建一个空间条件来解决扩散模型中精确标签控制的挑战,该条件将全局注视标签固定在局部瞳孔和虹膜几何形状上。通过利用冻结的 SegFormer 提取几何特征和物理眼部渲染器生成多样化的注视一致几何形状,GazeDiT 与其他扩散基线相比显著降低了注视标签误差,并提高了下游眼动追踪器的性能。 AI
影响 这项研究可能通过改进的合成数据生成,带来更准确、更高效的眼动追踪系统。
排序理由 该集群包含一篇详细介绍新模型及其技术贡献的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →