diffusers
PulseAugur coverage of diffusers — every cluster mentioning diffusers across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Hugging Face 聚焦多样化的 AI 工具和项目
Hugging Face 通过其博客展示了各种 AI 项目和工具。最近的帖子包括来自 TII UAE 的 Falcon Perception、DeepInfra 作为推理提供商的角色,以及 Hcompany 的 AI 浏览器合作伙伴 HoloTab。此外,还展示了 OpenAI 的 Web 应用隐私过滤器、nunchaku 的 4 位扩散推理集成到 diffusers 中,以及 Baseten 作为 Hugging Face 推理提供商的公告。
-
MiniMax AI 发布开源音乐模型,并在视频编辑基准测试中名列前茅
MiniMax AI 发布了 Minimax Music 3,这是一个开源的音乐生成模型,采用了 8B LLM 和 2.7B Diffusion Transformer。该模型能够根据文本提示和歌词生成完整的歌曲,并通过 diffusers 和 Comfy 等库在消费级 GPU 上运行。此外,MiniMax AI 还宣布其 H3 模型 MiniMax-H3 在 Video Edit Arena 中取得了最高排名,获得 1390 分,超…
-
MiniMax H3 模型通过 Sol Engine 实现重大速度提升
MiniMax AI 宣布使用 Sol Engine 显著提高了其 MiniMax H3 模型的速度。这款原生于代理的 Sol Video Inference Engine 比 Diffusers 快 3.95 倍,比 SGLang 快 2.80 倍。该引擎通过处理 8 个 Nvidia GB200 单元,在 1344x768 分辨率和 24 FPS 下处理 124 帧,展示了其能力。
-
本地 AI 更新:llama.cpp、PyTorch、Kimi-K3 和 NVIDIA NeMo Speech 3.0
本地 AI 和开源模型领域的最新更新包括 llama.cpp 通过 CUDA Fusion 实现的性能增强,解决了 PyTorch 中针对 AMD GPU 的关键量化错误,以及备受关注的 Moonshot AI Kimi-K3 模型,该模型利用压缩张量实现高效推理。此外,NVIDIA 发布了 NeMo Speech 3.0,专注于核心语音 AI 任务,LiquidAI 的 LFM2.5-2.6B 模型在本地代理部署方面也日益受到欢迎。
-
MiniMax Music 3 模型利用 Qwen3-8B LLM 生成完整歌曲
MiniMax Music 3,一个能够生成长达五分钟完整歌曲的新的开源模型已发布。该模型采用混合方法,结合了从 Qwen3-8B 初始化、用于长程结构的 8B 全局 LLM 和用于细粒度声学细节的 0.6B 局部 LLM。它可以根据歌词和详细的音乐描述进行条件生成,产生 32 kHz、16 位立体声 WAV 音频。该模型可通过 SGLang-Omni 和 diffusers 在本地使用,并通过 Hugging Face 和 audi…
-
llama.cpp 针对 Apple Silicon 进行优化,Hugging Face 提升 4 位扩散推理速度
最新发布的 llama.cpp 版本 b10299 为 Apple Silicon 引入了优化,通过 Metal API 提升了在 macOS 和 iOS 设备上的性能。此外,Hugging Face 详细介绍了其 Nunchaku 4 位扩散推理集成到 Diffusers 库中,显著降低了 VRAM 需求并加速了消费级 GPU 上的图像生成。NVIDIA NemotronLabs VoiceChat-11B 模型也在 Hugging…
-
Hugging Face 重点介绍新的推理提供商和 AI 工具 · 跟踪 4 个来源
Hugging Face 正在重点介绍几家正在增强其推理能力的公司和项目。DeepInfra 已被列为推理提供商,而 Hcompany 的 HoloTab 被介绍为 AI 浏览器合作伙伴。此外,Nunchaku 的 4 位扩散推理已集成到 diffusers 中,Baseten 也被宣布为该平台的推理提供商。
-
MiniMax AI发布H3视频模型开放权重,点燃社区创新
MiniMax AI已发布其MiniMax-H3视频模型的开放权重,在开源社区内引发了快速的创新。发布后的48小时内,用户在非传统硬件上展示了该模型的能力,包括低成本游戏GPU和MacBook,并开发了支持它的新工具。这种快速的采用和开发突显了社区对开放权重模型的参与度。
-
MiniMax H3 视频模型发布,权重开放,可通过平台访问
MiniMax AI 已正式发布其新的全模态生成系统 MiniMax H3,该系统能够生成具有同步立体声音频的视频,分辨率高达 2K,时长可达 15 秒。该模型现已在 Hugging Face 公开提供,并为不同用例提供了各种配置和权重,包括用于更快视频生成的 LoRA。尽管功能强大,但由于不断变化的 AI 法规,该模型在某些地区(如美国和欧盟)的可用性受到限制,但它正在被集成到秘塔AI等平台中,为创作者提供可访问、低成本的生成选项。
-
新的AI技术支持本地扩散模型和高性价比编码
一种名为Nunchaku的新的4位量化技术已集成到Hugging Face的Diffusers库中,在不牺牲质量的情况下显著减少了扩散模型所需的VRAM。这使得强大的生成式AI模型更容易在消费级硬件上本地部署。此外,还有关于在Windows和Linux上自托管AI代理(如Claude Cowork)的指南,支持本地任务自动化并增强隐私。文章还指出了使用Claude Opus等高级模型进行简单编码任务的成本效益低下,提倡对常规操作使用小…
-
Hugging Face 集成了 Nunchaku 用于 4 位扩散推理
Hugging Face 推出了 Nunchaku,一种新的 4 位扩散推理方法。该技术已集成到 diffusers 库中,旨在提高 AI 生成内容的效率。
-
Microsoft 发布 Mage-Flow,一款紧凑型 4B 图像生成模型
Microsoft 发布了 Mage-Flow,这是一款紧凑型 4B 规模的生成模型,专为高效的文本到图像生成和基于指令的图像编辑而设计。该模型通过协同设计的标记器 (Mage-VAE) 和多模态扩散 Transformer (NR-MMDiT) 实现了具有竞争力的质量,能够生成高达 2048 像素的原生分辨率图像。Mage-Flow 及其编辑变体 Mage-Flow-Edit 有基础版、RL 对齐版和 Turbo 版,与更大的模型相…
-
PEFT方法为大型语言模型提供高效微调
参数高效微调(PEFT)通过仅训练一小部分参数或添加轻量级组件,为适应新的任务提供了大型预训练模型的方法。这种方法与完全微调不同,它显著降低了GPU内存需求和检查点大小,从而能够创建小型、便携、特定任务的适配器。虽然LoRA和提示调优等PEFT方法不能保证与完全微调相同的性能,但它们大大降低了计算需求和存储成本。
-
NVIDIA发布Nemotron 3.5安全模型和NeMo AutoModel用于大规模微调 · 跟踪2个来源
NVIDIA发布了Nemotron 3.5,这是一个专为全球企业设计的多模态安全模型。该模型提供可定制的内容安全解决方案。此外,NVIDIA的NeMo AutoModel与Hugging Face的diffusers库结合使用,可以对视频和图像模型进行大规模微调。
-
NVIDIA 和 Hugging Face 发布 NeMo Automodel,用于可扩展的扩散模型微调
NVIDIA 和 Hugging Face 合作发布了 NeMo Automodel,这是一个开源的 PyTorch 库,旨在简化扩散模型的微调过程。这个新工具允许用户在 Hugging Face Diffusers 格式下训练和微调模型,而无需进行任何代码重写或检查点转换。NeMo Automodel 支持多种并行策略,包括 FSDP2、张量并行和流水线并行,能够从单个 GPU 扩展到数百个 GPU 进行训练。
-
Krea 2 通过新的 LoRA 获得身份参考和外绘功能
一位用户发布了两个用于 Krea 2 的功能 LoRA,专注于身份参考和位置外绘能力。身份参考 LoRA 允许在保持身份一致性的同时更改服装、姿势、构图和背景,利用 Qwen3-VL 图像条件和 VAE 参考令牌。位置外绘 LoRA 通过将源图像放置在特定位置并填充周围区域来扩展图像。这两个 LoRA 都提供权重、Diffusers 管道和可运行的示例,专为本地推理设计,无需托管 API。
-
Hugging Face 发布 Krea 2 Turbo 风格参考 LoRA
Hugging Face 上发布了一个新的 LoRA 模型 ostris/krea2_turbo_style_reference,用户可以使用 Krea 2 Turbo 模型根据参考图像生成图像。该 LoRA 使用 AI Toolkit 的实验性 Krea 2 参考图像训练器和数千对精选的风格对进行训练。它设计用于一个或两个参考图像,并提供了与 Diffusers 等库以及 Comfy UI 和 Draw Things 等应用程序集成的说明。
-
Robbyant发布LingBot-Video,一款开源MoE视频生成模型
Robbyant发布了LingBot-Video,这是一款开源的混合专家(MoE)视频生成模型,专为具身智能设计。该模型在包含网络视频和具身数据的海量数据集上进行训练,采用高效的MoE架构,推理速度比以往模型快约三倍。LingBot-Video集成了多奖励系统,优先考虑输出的美学质量、物理合理性和任务完成度。
-
Robbyant团队发布LingBot-World 2.0,支持无界交互
Robbyant团队发布了LingBot-World 2.0,也称为LingBot-World-Infinity,这是他们世界建模系统的先进迭代版本。新版本具有无界交互视野和一致的输出质量,响应速度快,支持60 fps视频流,并引入了更广泛的交互元素,包括战斗和文本驱动的事件。它还引入了一个用于规划和合成环境元素的代理工具,通过Reactor和LingGuang提供实时变体,并将在WAIC 2026上展示全部功能。
-
NVIDIA 发布 Qwen-Image-Flash 以实现快速文本到图像生成
NVIDIA 发布了 Qwen-Image-Flash 模型,这是 Qwen/Qwen-Image 模型的蒸馏版本,专为快速文本到图像生成而设计。该模型采用四步 DMD2 蒸馏过程,并针对 NVIDIA 硬件进行了优化,提供更快的推理速度。它适用于商业和非商业用途,面向开发人员和研究人员,用于创意内容原型设计和对延迟敏感的应用。