ControlNet
PulseAugur coverage of ControlNet — every cluster mentioning ControlNet across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
-
Anima AI模型生态系统因缺乏ControlNet支持而受到批评
一位Reddit用户对Anima AI模型的生态系统表示失望,特别是其缺乏ControlNet模型。尽管承认Anima的潜力,但用户指出,其当前的能力,尤其是在深度控制方面,与Illustrious或NoobAI等成熟模型不匹配。开发商Circlestone Labs未提供官方ControlNet支持,这让用户质疑Anima的普及度,以及用户是继续使用旧模型还是转向Krea2等替代品。
-
用户结合使用 Krita、Gemini 和 Stable Diffusion 进行粉丝艺术创作
一位用户分享了他们为《女神异闻录4》中的千枝(Chie Satonaka)创作粉丝艺术的流程,该流程结合了传统素描和数字工具。该过程包括使用 Gemini 进行手动线条提取和优化,然后在 Krita 中进行数字着色。之后,用户使用 Krita AI Diffusion 插件和 ControlNet 的 Stable Diffusion 1.5 生成最终图像,通过详细的提示词和负面提示词来实现网络漫画风格的插图。
-
AI视频生成采用3D分层构图以增强场景控制
一种新的AI视频生成工作流程正在出现,它结合了3D分层构图模型(Previs)来增强对场景构图和镜头运动的控制。updream的Previs Studio等工具允许创作者在生成最终视频输出之前构建简单的3D场景,定义镜头角度,并规划角色动作。这种方法旨在弥合基于文本的提示词与专业电影制作所需的精确空间和时间控制之间的差距,减少试错,提高AI生成视频内容的预测性。
-
RulerNet框架学习透视不变尺子表示以实现尺度估计
研究人员开发了RulerNet,一个新颖的深度学习框架,旨在准确估计图像中物体在现实世界中的尺度。该系统将尺子读数重新定义为关键点检测问题,利用几何级数参数来处理透视畸变。RulerNet采用基于标记可见性的标注和训练策略,并通过利用ControlNet生成逼真合成数据的管道得到增强,从而实现了在各种尺子类型和成像条件下的鲁棒泛化。
-
Kohya-SS 发布 Anima-LLLite ControlNet,用于高级 Stable Diffusion 动画编辑
Kohya-SS 悄然发布了一个新的 ControlNet 模型 Anima-LLLite,为 Stable Diffusion 用户提供了高级动画编辑功能。该模型在 Reddit 帖子发布前约 11 天上传,能够对现有图像进行重大修改,例如更改背景、服装,甚至在场景中添加或改变角色。早期测试表明取得了显著效果,能够进行详细的场景构图和角色互动。
-
SimplePoster框架通过增强主体保留和文本准确性来改进产品海报生成
研究人员开发了SimplePoster,一个用于生成产品海报的新颖框架,在保留产品外观和准确渲染文本方面表现出色。与依赖ControlNet等复杂架构的先前方法不同,SimplePoster使用基础模型的全参数微调来防止主体延伸伪影,并使用零成本字符级位置编码进行几何感知文本生成。该方法实现了98.7%的主体保留率,显著优于现有方法,并提高了文本渲染准确性。
-
AI图像生成器利用先进工具探索“黑客帝国”主题
该集群关注AI图像生成工具的创意潜力,特别是引用了“黑客帝国”及其标志性的“红色药丸/蓝色药丸”选择。讨论中重点介绍了各种AI艺术平台和技术,包括Stable Diffusion、Midjourney、DALL·E 3,以及ControlNet、ComfyUI和AUTOMATIC1111 Stable Diffusion Web UI等高级界面,表明人们对利用AI探索复杂视觉概念的广泛兴趣。
-
机器人可能不需要专用大脑,而是利用视频模型
一篇新论文介绍了一种名为 Masked Visual Actions (MVA) 的方法,该方法通过利用视频生成模型来统一机器人的世界建模和动作生成。MVA 不训练专门的机器人基础模型,而是将动作视为视频帧内的掩码轨迹,从而使机器人能够直接利用成熟的视频模型。这种方法只需要极少的微调,在不同机器人硬件上展现出强大的零样本泛化能力,并为工业自动化中的跨体挑战提供了潜在解决方案。
-
AI框架RareFlow提升遥感图像分辨率
研究人员开发了RareFlow,一种用于增强遥感图像分辨率的新型AI框架。该系统将低分辨率的Sentinel-2图像转换为高分辨率的Maxar类图像,特别侧重于识别稀有的地质特征。RareFlow采用双条件方法,结合了用于几何一致性的门控ControlNet和用于上下文信息的文本引导,以及多方面损失函数以确保输出保真度。
-
新的扩散模型使用小波域条件生成卫星图像
研究人员开发了一个新颖的扩散框架,该框架利用小波域条件从地图数据生成卫星图像。该方法建立在ControlNet和Stable Diffusion骨干之上,采用了在地图和小波表示上训练的两个适配器,并通过MultiControlNet进行融合。该方法在新德尼泊尔数据集和Pix2Pix地图-卫星基准上进行了评估,在图像保真度和分布真实性相关的几个指标上优于现有方法。
-
Krea 2 用户讨论并寻求解决图像“模糊”瑕疵的方法
Reddit 上的用户正在讨论 Krea 2 生成的图像中出现的视觉瑕疵,这种瑕疵被描述为“斑驳的模糊”,尤其是在其 Turbo 模式下。这个问题似乎因更高的扩散步数或更强的采样器设置而加剧。虽然一些用户尝试了诸如使用 tile ControlNet 的低扩散图生图技术或将 Krea 2 Raw 与 Turbo LoRA 结合使用等方法,但尚未找到在不改变图像细节的情况下消除该瑕疵的明确解决方案。
-
新的 ControlNet 方法将姿态和深度集成到 FLUX.2 模型中
一种新的方法已被开发出来,用于将姿态和深度控制集成到 FLUX.2 系列图像生成模型中。该方法利用现有的姿态、深度或边缘映射 ControlNet 模型,然后将这些模型作为参考图像输入到 FLUX.2 中。与传统方法不同,该技术不需要 FLUX.2 变体使用加载器链或额外的权重,从而使结构控制在整个系列中变得免费且一致。
-
Stable Diffusion 用户寻求 ANIMA Circlestone Lab 的 ControlNet 模型
一位 Reddit 用户正在询问 ANIMA Circlestone Lab 模型是否可用 ControlNet 模型,特别是用于图像修复(inpainting)任务。他们还就为此类目的开始使用 ComfyUI 寻求建议,并询问学习难度。
-
LiDARDraft 从文本、图像和草图生成激光雷达点云
研究人员推出了一种新颖的方法 LiDARDraft,可以从文本、图像和草图等多样化输入生成逼真的激光雷达点云。该方法利用 3D 布局作为中间环节,连接各种条件信号与激光雷达点云生成。通过将输入转换为统一的 3D 布局,然后转换为语义和深度控制信号,LiDARDraft 采用基于范围图的 ControlNet 进行精确的像素级对齐,从而能够创建自定义的自动驾驶模拟环境。
-
Krea 2 集成 ControlNet,实现 3D 姿态驱动的图像生成
一位开发者创建了一个 3D 姿态编辑器的演示,该编辑器将原始骨架转换为深度图,然后可与 Krea 2 结合用于图像生成。此集成利用了 Krea 2 的深度 ControlNet LoRA,从而能够更精确地控制生成的姿态。该项目旨在构建一个 3D 空间姿态编辑器,用户可以通过操纵骨架来影响图像生成,目前的功能适用于 Z Image 和 Krea 2。
-
新研究探索使用扩散模型进行高级图像修复
两篇新研究论文探讨了使用扩散模型进行高级图像修复的技术。第一篇论文介绍了一种无噪声、单步LoRA方法,该方法通过利用预训练的扩散先验来改进任务驱动的图像修复,其性能优于多步扩散方法,并在分类、分割和检测任务中有所提升。第二篇论文提出了TDiR,一个基于Transformer的扩散模型,旨在增强降级图像在去噪和去雨等各种任务中的表现,在多个基准测试中展现出优于现有最先进技术的性能。
-
Stable Diffusion 用户寻求本地模型建议以实现角色一致性
一位 Reddit 用户正在寻求关于在本地运行 Stable Diffusion 模型以在图像中生成一致角色的指导。他们在尝试使用 Flow 和 Gemini 等工具时遇到了角色一致性问题,并正在寻找适合其笔记本电脑规格(6800h、3070ti、16GB RAM)的模型建议。该用户特别提到尝试使用 Hugging Face 模型运行 Stable Diffusion 1.5,但遇到了困难。
-
AI图像生成用户结合Krea 2和Flux以增强细节
一位Reddit用户分享了一种结合两种不同AI图像生成模型Krea 2和Flux以获得更好结果的技术。通过将Krea 2的输出输入Flux,用户能够克服Krea 2在细节和真实性方面的局限性,同时利用Flux处理高分辨率和人体结构的能力。据报道,这种两阶段过程的生成时间与之前的方法相似。
-
AI图像的动感取决于主体、环境和相机运动
一篇Reddit上的讨论探讨了使静态图像(尤其是AI生成的图像)显得充满动感的要素。大家普遍认为有三个关键层面:主体运动(如扭转的身体或飘动的头发)、环境运动(如运动模糊或碎片)以及相机运动(包括低角度和强透视)。该帖子指出,如果背景和相机保持静止,仅仅添加一个动态姿势是不够的,并建议使用OpenPose/ControlNet等工具来处理复杂姿势,而不是仅依赖提示词。
-
新的LLIFT框架生成逼真的医学图像用于AI验证
研究人员开发了一个名为局部标签信息特征迁移(LLIFT)的新框架,用于生成具有逼真病变的半合成脑部MRI图像。该方法旨在为医学影像中可解释人工智能(XAI)技术的验证创建更可靠的地面真实数据,克服专家标注和不切实际的人工扰动的局限性。LLIFT可以使用定制的生成对抗网络(LLIFT-GAN)或基于扩散的修复流程(LLIFT-DM)来实现,这两种方法都以边界框掩码为条件。对人类连接组项目数据的评估表明,两种LLIFT实现均取得了具有竞争…