Jong Chul Ye
PulseAugur coverage of Jong Chul Ye — every cluster mentioning Jong Chul Ye across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的CRePE方法增强了视频生成模型中的相机控制
研究人员开发了一种名为弯曲光线期望位置编码(CRePE)的新方法来改进视频生成模型。CRePE通过沿统一相机模型光线表示具有深度感知的图像标记分布来解决现有相机编码技术的局限性。这种方法增强了对相机参数、镜头类型和方向的控制,在针孔、广角和鱼眼镜头上表现良好。该方法可以与冻结的视频扩散Transformer无缝集成,还可以整合外部几何图以进行场景几何条件生成。
-
FILT3R层通过自适应卡尔曼滤波器增强流式3D重建
研究人员推出FILT3R,这是一种新颖的无需训练的层,旨在通过自适应更新潜在状态来改进流式3D重建。该方法将状态更新视为令牌空间中的随机估计,维护每个令牌的方差,并采用类似卡尔曼的增益来平衡记忆保留和新观测。FILT3R从时间漂移中在线估计过程噪声,与现有技术相比,在深度、姿态和3D重建方面实现了更长的视距稳定性。
-
Memory-V2V 框架增强多轮视频编辑的一致性
研究人员开发了 Memory-V2V,一个旨在提高多轮视频编辑一致性的新颖框架。现有的视频到视频扩散模型在顺序编辑方面常常遇到困难,导致不一致,因为先前生成区域会漂移或被覆盖。Memory-V2V 通过整合一个内存增强方法来解决这个问题,该方法存储和检索先前的编辑,并将它们视为后续生成的约束。这种方法增强了迭代新视角合成和文本引导长视频编辑等任务的跨轮一致性,同时以最小的计算开销保持视觉质量。
-
InverseCrafter框架可在无需VDM微调的情况下实现高效视频重捕获
研究人员推出了一种新颖的框架InverseCrafter,用于在无需对预训练视频扩散模型(VDM)进行大量微调的情况下生成视频的新视角。该方法将视频重捕获视为潜在空间中的逆问题,利用轻量级的潜在掩码编码器来避免计算成本高昂的训练和灾难性遗忘问题。InverseCrafter通过以最小的额外推理成本保留原始VDM的生成能力,实现了高效、高保真的视频修复和编辑。
-
AgentPSO框架利用粒子群优化演进大型语言模型的推理能力
研究人员开发了AgentPSO,一个利用粒子群优化方法来增强大型语言模型推理能力的新型框架。与依赖推理时交互的现有方法不同,AgentPSO在不改变骨干语言模型参数的情况下,迭代地演进单个智能体的推理能力。这种方法允许智能体学习并结合自身的经验以及群体中最强的技能,从而在数学和通用推理基准测试中取得更好的性能。演进出的技能已被证明在不同基准测试中甚至可以迁移到其他骨干模型,表明捕获了可重用的推理过程。
-
新的PACE-RAG框架增强了帕金森病患者的个性化药物推荐
研究人员开发了PACE-RAG,一个新颖的检索增强生成框架,旨在改善帕金森病等复杂疾病患者的药物推荐。与使用通用指南或复制常见治疗模式的现有方法不同,PACE-RAG通过提取患者特定的临床特征来实现个性化推荐。然后,它根据当前症状、活动药物和特定的处方倾向来优化处方,并提供可解释的临床摘要。在使用Llama 3.1:8b和Qwen3 8B模型在MIMIC-IV基准上进行评估时,PACE-RAG取得了最先进的F1分数,证明了其在临床决策…