ControlNet
PulseAugur coverage of ControlNet — every cluster mentioning ControlNet across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
-
新方法可在扩散模型图像风格化中实现局部内容-风格控制
研究人员开发了一种使用潜在扩散模型进行图像风格化的新方法,该方法允许对内容和风格进行局部控制。通过将条件权重视为空间图而不是全局标量,该技术可以在不重新训练模型的情况下实现图像描绘方式的区域特定调整。这种方法扩展了润饰词汇,并确保编辑仅限于目标区域。
-
新的免费姿势工具支持 OpenPose 和 ControlNet,助力 AI 图像生成
一个新开发的、免费的、基于浏览器的姿势工具,旨在帮助用户为 AI 图像生成创建自定义姿势。该工具支持多种输出格式,包括 OpenPose、ControlNet 和 VNCCS,并提供草图模式来生成简单的绘图参考。尽管该工具仍在开发中,存在一些粗糙之处,尤其是在手部渲染方面,但开发者正在积极征求用户反馈以进行改进。
-
ProgressNet 使得使用冻结的文本到图像模型进行实时渐进式绘图成为可能
研究人员开发了 ProgressNet,一个新颖的框架,使得冻结的文本到图像模型能够进行渐进式绘图。该方法允许用户添加或擦除笔触并修改提示,图像近乎实时地更新,每轮大约一秒钟。ProgressNet 不需要新参数,并利用三种推理时机制来在不同草图域中保持保真度和连贯性,性能优于现有方法和用户偏好。
-
AI图像生成用户怀念旧模型和技术
Reddit上的r/StableDiffusion板块发布了一个帖子,邀请用户分享他们对早期AI图像生成模型和技术的体验和回忆。讨论旨在记录该领域的快速发展,突出可能因技术进步而过时的细微或不寻常的方法。鼓励用户回顾他们在使用Stable Diffusion、SDXL等模型以及Midjourney、DALL·E 3等竞争对手,以及ControlNet等工具和各种定制方法(Loras)过程中的个人经历。
-
30,000 个艺术 QR 码幻象数据集开源
一个包含 30,000 个艺术 QR 码幻象的数据集已在 Hugging Face 上开源。数据集中的每张图片都旨在将 QR 码无缝集成到各种艺术风格和纹理中,并已针对多种解码器以及旋转和模糊等不同条件下的可扫描性进行了测试。该数据集旨在用于训练 ControlNet 和 LoRA 等 AI 模型。
-
HyperSAM:高光谱遥感的新基础模型
研究人员开发了HyperSAM,一个用于高光谱遥感的新型基础模型。该模型通过从多光谱图像合成高分辨率高光谱立方体并使用伪掩码进行监督,解决了现有数据集的局限性。HyperSAM利用了冻结的Segment Anything Model 3 (SAM3)架构,并针对高光谱数据进行了调整,包括一个可训练的编码器和一个专家混合掩码精炼器。实验证明了其在各种遥感任务中的有效性,表明高质量的合成数据可以优于嘈杂的真实世界监督。
-
GeoVerse 框架增强了世界一致性的新视角合成
研究人员推出 GeoVerse,一个新颖的框架,用于从稀疏图像合成世界一致性的新视角。该方法将 3D 基础模型的几何潜在空间与视频生成模型的外观先验相结合。GeoVerse 通过全局空间记忆增强结构完成并确保跨视图一致性,从而在 DL3DV 和 Mip-NeRF360 等基准测试中,在视觉质量和几何一致性方面优于 GLD 等现有方法。
-
Forge Neo 无法加载 ControlNet 模型,默认使用预设模型
Forge Neo 的用户遇到了一个问题,即该软件无法加载任何选定的 ControlNet 模型。Forge Neo 没有加载所选模型,而是默认下载预处理器所需的预设模型。无论使用何种基础模型或进行何种特定的设置调整,都会出现此问题,并且控制台中不会显示任何错误消息。
-
AI使用多模态Stable Diffusion XL生成符合文化习俗的Ulos图案
研究人员开发了一个多模态生成框架,通过实现可控且符合文化习俗的图案生成,来帮助传统的巴塔克Ulos编织业。该系统使用LoRA对Stable Diffusion XL进行微调,并与LLaMA 1.5-7B集成,采用四种条件机制:通过ControlNet的文本、图像、表示和语义图。消融研究表明,文本、图像和语义图条件的组合在FID和CLIP Score方面产生了最佳结果,而文本、图像和表示则提供了一种平衡的方法。用户评估证实了统计学上显著…
-
MiniMax H3 姿态控制方法简化了 AI 视频生成
一种使用 MiniMax H3 控制 AI 生成视频中角色姿态的新方法已被开发出来,它提供了传统 ControlNet 方法的替代方案。该技术利用参考视频上的外绘来实现一致的运动,即使在角色比例不同时也能实现,但需要更多的 VRAM。该方法已被证明可以在单个 3090 GPU 上有效运行,并详细说明了生成时间和 VRAM 使用情况。
-
MiniMax H3 ControlNet 增强 3D 渲染到视频转换
一个名为 MiniMax H3 的新 ControlNet 模型已被开发出来,旨在改进将原始 3D 渲染转换为视频的过程。据报道,该模型在保留视频 ControlNet 的参考图像和运动数据以及相机运动方面找到了最佳平衡点。目标是实现与 Seedance 2.5 相似的视频质量。
-
新流水线自动化可控裂缝数据合成
研究人员开发了一种自动生成可控裂缝数据的流水线,解决了现有深度学习方法在稀缺且控制不佳的缺陷数据方面存在的局限性。该新流水线将裂缝几何形状和检测上下文形式化为计算约束,使用贝塞尔曲线通过 GAN 创建逼真的裂缝掩码。然后,一个双 ControlNet 扩散框架将外观和几何引导解耦,确保边界一致性,并支持无背景合成和上下文感知修复。
-
SDXL用户寻求通过参考图更好地控制人物姿势
一位Reddit用户正在寻求建议,关于如何在Stable Diffusion XL (SDXL) 中有效控制人物姿势,同时保持参考图中的人物外观。他们正在使用IP-Adapter(用于外观)和ControlNet(用于姿势条件控制)的组合,但遇到了模型重复特征或产生不一致结果的冲突。由于资源限制,用户正在寻找无需对SDXL进行大量重新训练即可改进姿势控制的方法。
-
StableDiffusion 用户寻求逐帧一致的角色动画工作流程
一位Reddit用户正在寻求关于使用StableDiffusion和LoRA模型为动画项目实现逐帧角色一致性的建议。他们正在寻找在不生成背景或音频的情况下,保持角色身份和清晰线条艺术的方法,并特别询问ComfyUI中的节点设置或ControlNet和IP-Adapter的配置,以防止闪烁和LoRA漂移。该用户明确表示,他们更喜欢开源解决方案,而不是一体化的商业AI视频生成器。
-
用户寻求通过程序生成Unity的ControlNet姿势
一位Reddit用户正在寻找一种方法来生成ControlNet输出以实现特定姿势,特别是用于Unity游戏引擎。他们在使用AI图像生成器时遇到困难,无法准确描绘肢体可能重叠的复杂姿势。用户正在寻找一种通过程序创建这些姿势的方法,可能通过使用数字玩偶或化身来定义所需的姿势。
-
Krea2 用户寻求集成 ControlNet 以实现高级 AI 图像生成
Reddit 上的用户正在询问 Krea2(一款 AI 图像生成工具)是否可能集成 ControlNet 功能。核心问题在于 Krea2 是否会支持高级 ControlNet 功能,如深度图、Canny 边缘检测或分割,这将允许更精确地控制生成的图像样式和结构。目前的变通方法被指出是模仿 ControlNet 而非提供完整功能,这导致用户期待真正的实现。
-
新的PRISM框架通过组合奖励改进医学图像生成
研究人员推出了一种新的PRISM框架,用于使用组合奖励模型(CRMs)生成条件医学图像。与依赖单一标量奖励的先前方法不同,PRISM将图像质量分解为不同的阶段,评估诸如强度、纹理、结构对齐和语义保真度等方面。这种分层方法确保在考虑更高级属性之前先纠正更低级的图像属性,从而提供更有效的训练信号。在用于下游任务生成数据时,PRISM在多个医学成像数据集的分割和分类准确性方面均有所提高。
-
新框架统一SAR到光学图像翻译和语义分割
研究人员开发了一个名为BMT(Bridging Modalities and Tasks)的统一框架,该框架使用分层Vision Transformer同时执行合成孔径雷达(SAR)到光学(S2O)图像翻译和语义分割。该方法通过整合对下游应用至关重要的语义结构,解决了现有S2O方法的局限性。该框架采用新颖的LocalViTBlock进行特征融合,增强的输出模块进行图像校准,类似ControlNet的条件注入机制,以及有界的Kendal…
-
用户学习 Stable Diffusion 以实现复杂角色照片集成
一位 Reddit 用户分享了他们学习 Stable Diffusion 以创作特定艺术作品的历程。最初只打算创作一件作品,但他们决定将其扩展成一个系列。用户在将迪士尼和 Looney Tunes 角色与自己的照片相结合时遇到了挑战,需要精确匹配姿势、光照和视角。为了实现这一点,他们深入研究了 Fooocus、ComfyUI、ControlNet 和 IP-Adapter 等工具,并就高级工作流程向社区寻求建议。
-
ProAct框架实现实时具身社交互动
研究人员推出ProAct,一个用于实时具身社交互动的新型双系统框架。该系统集成了低延迟的行为系统,用于生成多模态互动,以及处理长时域社交推理和主动意图的认知系统。ProAct旨在满足连续流畅行为和主动决策在严格延迟预算内的苛刻要求。