Fréchet inception distance
PulseAugur coverage of Fréchet inception distance — every cluster mentioning Fréchet inception distance across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
新方法校准生成模型训练路径以提高性能
研究人员推出了一种新颖的生成模型训练方法——难度校准流匹配。该方法在试运行期间根据模型的学习难度动态调整噪声到数据的插值路径。通过在路径中更具挑战性的部分停留更长时间,该技术旨在提高收敛性和样本质量。在 CIFAR-10 和 MNIST 等标准数据集上的实验表明,在计算资源受限的训练场景下,其在 Fréchet Inception Distance 方面表现更优。
-
新的OccluRank框架通过序数遮挡控制增强图像生成
研究人员推出了一种新颖的布局到图像生成框架OccluRank,该框架通过为每个边界框引入一个简单的序数秩次来增强对遮挡的控制。该方法允许用户指定遮挡顺序,然后通过基于秩次的条件设置进行编码,并通过感知顺序的实例交互(OII)模块进行处理。该框架还包括用于训练的合成数据集OccluLayout,以及使用多模态LLM评估器和FID分数进行评估的基准OccluLayout-Bench。实验表明,OccluRank能有效保留目标实例,遵循指定…
-
新的MeanFlow-Transfer方法加速生成模型训练
研究人员开发了一种名为MeanFlow-Transfer (MF-T)的新方法,用于在数据有限的新领域上加速生成模型的训练。该方法通过将不同的源模型输出映射到共享的速度表示中,实现了适应和加速的统一,从而能够优化各种预训练模型。此外,还引入了Continuous Adversarial MeanFlow (CAMF)作为一种训练后技术,通过将对抗性精炼扩展到有限区间平均速度,增强了对精细细节的恢复能力,提高了图像质量,并显著减少了所需…
-
新型扩散模型生成可控高风险驾驶场景
研究人员开发了一种新颖的生成安全关键驾驶场景以增强自动驾驶系统的管道,名为RiskMV-DPO。该方法通过整合目标风险水平与基于物理的风险建模,实现了风险可控的多视角场景生成。该系统合成了多样化的高风险动态轨迹,并使用几何外观对齐模块和区域感知直接偏好优化策略来确保时空连贯性和几何保真度。实验表明,3D检测mAP显著提高,Fréchet inception distance降低,为主动、风险可控的综合世界模型奠定了基础。
-
新研究为CycleGAN增强功能提供部署感知顺序
一篇新研究论文提出了一种部署感知的采用顺序,用于循环一致对抗网络(CycleGANs)的增强功能。CycleGANs是一种用于图像到图像翻译的生成模型。该论文确定了四个关键增强功能,解决了诸如训练不稳定和纹理漂移等常见问题。它根据计算成本和对部署的影响对这些增强功能进行了分类,并为具有特定计算或延迟预算的团队提出了采用顺序。研究还详细介绍了如何在马到斑马的翻译任务中集成和评估这些增强功能,并报告了如Fréchet Inception …
-
新研究质疑弗雷歇起始距离的可靠性
一篇新发布的arXiv论文探讨了常用于评估合成图像质量的弗雷歇起始距离(FID)指标的可靠性。该研究由Ciaran Bench撰写,调查了随机嵌入表示,特别是通过蒙特卡洛Dropout,如何揭示FID中的预测方差。这些方差与测试输入的分布外情况相对于训练数据的关系相关,为评估图像特征的FID的可靠性提供了见解,尤其是在诸如医学成像等领域,在这些领域,在ImageNet1K上预训练的InceptionV3等模型可能不是理想选择。
-
摩擦增强漂移模型增强了资源高效的域迁移
研究人员推出了一种新颖的域迁移方法——摩擦增强漂移模型(DMF),该方法显著提高了资源效率。DMF通过引入一个预定的摩擦系数来解决现有漂移模型(DMs)的局限性,该系数可防止模型进入局部排斥状态。与标准的DMs相比,该方法提高了合成保真度并降低了计算成本,其性能甚至可以与更复杂的方法(如最优流匹配(OFM))相媲美,同时所需的训练时间大大减少。
-
新的LOB-ID框架使用AI嵌入评估生成式市场数据
研究人员推出LOB-ID,一个用于评估AI模型生成的生成式市场数据的新框架。该框架将现有的基于嵌入的指标,如Fréchet Inception Distance (FID)和Monge Inception Distance (MIND),应用于限价订单簿(LOBs)的特定领域。通过在大量的LOB数据上训练DeepLOB架构,LOB-ID可以评估订单簿轨迹的时间和跨级别结构,比传统方法对失真更敏感。
-
新的因果变分深度嵌入框架解决了混淆图像生成问题
研究人员推出 CauVaDE(因果变分深度嵌入),一个新颖的框架,旨在解决深度生成模型中因未观测到的混淆因素而从训练数据中继承虚假关联的挑战。CauVaDE 将这些混淆因素建模为离散的潜在集群,从而允许跨越可行区域的可追溯干预分布族。在图像数据基准上的实验表明,CauVaDE 能够生成多样化的干预样本,并在 Fréchet inception distance 方面优于现有方法。
-
新AI框架通过高级控制解决非配对图像翻译问题
研究人员开发了两个新的非配对图像到图像翻译框架,该任务涉及在不依赖配对示例的情况下改变图像的外观同时保留其内容。PRISM 使用分布门控流匹配方法来控制哪些特征被改变以及哪些被保留,在各种基准测试中取得了优异的结果。另一方面,UniCycleFlow 将双向翻译构建为单个时间条件速度场,从而实现双向连贯的转换,并在平均 FID 分数上优于现有方法。
-
流匹配模型在生成和效率方面得到增强 · 跟踪 5 个来源
研究人员正在通过整合已知的物理原理和提高训练效率来推进流匹配模型在生成任务中的应用。一种方法,能量引导流匹配 (EG-FM),使用移动的终点和自适应调度来逐步揭示高频细节,在图像生成方面取得了最先进的 FID 分数。另一种方法,幅度-方向解耦 (MDD),通过使用轻量级模型进行幅度和方向引导来加速视频生成,在保持质量的同时显著提高了速度。此外,一种称为 StructFlow 的新技术将空间局部性编码到源分布中,从而实现了细粒度的局部编…
-
GSRAIN方法为3D驾驶场景合成可控降雨
研究人员开发了GSRAIN,一种在3D高斯喷溅(3DGS)驾驶场景中合成逼真降雨的新颖方法。该技术整合了一个源自真实世界数据的高频雨滴模型,以及一个用于低频大气效应的几何感知扩散模型。GSRAIN能够精确控制降雨强度,范围从0到13毫米/小时,并且在弗雷歇起始距离方面,与CycleGAN-Turbo和WeatherEdit等现有方法相比,表现出优越的性能。生成的场景已通过目标检测和闭环驾驶实验进行了验证,证明了它们在为自动驾驶系统创建…
-
新的扩散模型使用小波域条件生成卫星图像
研究人员开发了一个新颖的扩散框架,该框架利用小波域条件从地图数据生成卫星图像。该方法建立在ControlNet和Stable Diffusion骨干之上,采用了在地图和小波表示上训练的两个适配器,并通过MultiControlNet进行融合。该方法在新德尼泊尔数据集和Pix2Pix地图-卫星基准上进行了评估,在图像保真度和分布真实性相关的几个指标上优于现有方法。
-
扩散模型的生成质量与数据对齐和伪随机输入相关
新研究探讨了扩散模型中生成图像的质量如何受到其内部机制的影响。一项研究将“专家-数据对齐”确定为关键因素,表明将图像生成步骤路由到在相关数据集群上训练的专家可以提高质量,而不是仅仅关注数值稳定性。另一篇论文揭示,这些模型使用的伪随机数流可以作为可学习的输入,根据其可预测的结构影响训练和生成结果。
-
DualDiT:扩散Transformer生成逼真的OCT图像和分割掩码
研究人员开发了DualDiT,一种新颖的条件双输出扩散Transformer,用于同时生成光学相干断层扫描(OCT)图像及其对应的分割掩码。该方法旨在解决标注医学成像数据稀缺的问题,特别是对于小鼠眼部OCT扫描,因为手动分割耗时。DualDiT将图像和掩码模态编码到共享的潜在空间中,实现联合合成,并在生成质量和感知真实性方面优于现有的扩散模型,如DDPM和LDM,并得到了领域专家的验证。DualDiT生成的合成数据也被证明在增强下游分…
-
新的PARSE框架增强了扩散模型中的概念擦除
研究人员开发了一个名为PARSE(Preservation-aware Adaptive Ranked Subspace Expansion,保留感知自适应排序子空间扩展)的新型无训练框架,旨在改进文本到图像扩散模型中的概念擦除。现有方法常常在有效擦除不希望出现的概念(如NSFW内容)与保留模型对良性概念的效用之间进行权衡。PARSE通过动态识别模型词汇表中诱导目标和附近保留的概念,编辑交叉注意力值空间以移除目标方向,同时保持保留方向…
-
新的扩散模型水印技术可保持保真度
研究人员开发了一种名为潜在角度水印(LAW)的新方法,用于在扩散模型中嵌入鲁棒水印。该技术在潜在空间中运行,确保不干扰模型的参数或生成过程。LAW解决了潜在高斯性和独立同分布(i.i.d.)条件被违反等问题,这些问题会降低生成保真度并使水印容易被移除。该方法将水印比特编码为潜在元素之间的对极角,而具有增强鲁棒性的幅度驱动变体(LAW-M)通过将比特锚定在稳定维度上来实现。
-
AI 框架减少 CBCT 扫描中的牙科植入物伪影
研究人员开发了一个无监督深度学习框架,使用精调的循环一致对抗网络 (CycleGAN) 来减少牙科锥束计算机断层扫描 (CBCT) 中的金属伪影。该方法利用了大约 4,000 张图像的非配对数据集,克服了监督方法的局限性,在 BRISQUE、FID 和 SSIM 等图像质量指标上取得了显著的改进。该框架展示了实时推理速度,并得到了专家的验证,尽管建议将其作为高保真牙科植入物成像的临床决策支持工具。
-
隐私保护 CT 切片生成框架发布
DS@GT ARC 的研究人员开发了一个新颖的框架,用于生成优先考虑隐私的合成肺部 CT 切片。他们的方法将最优传输条件流匹配与生成后过滤系统相结合。该系统使用自动编码器嵌入、行列式点过程和斯坦核稀疏化,根据学习到的几何潜在空间选择生成的切片,旨在平衡真实性与隐私保护。
-
新的LLIFT框架生成逼真的医学图像用于AI验证
研究人员开发了一个名为局部标签信息特征迁移(LLIFT)的新框架,用于生成具有逼真病变的半合成脑部MRI图像。该方法旨在为医学影像中可解释人工智能(XAI)技术的验证创建更可靠的地面真实数据,克服专家标注和不切实际的人工扰动的局限性。LLIFT可以使用定制的生成对抗网络(LLIFT-GAN)或基于扩散的修复流程(LLIFT-DM)来实现,这两种方法都以边界框掩码为条件。对人类连接组项目数据的评估表明,两种LLIFT实现均取得了具有竞争…