diffusers
PulseAugur coverage of diffusers — every cluster mentioning diffusers across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Prism模型支持2K视频音频生成,采用动态稀疏注意力机制
一款名为Prism的新模型已发布,专为高达2K分辨率的原生联合视频音频生成而设计。Prism由复旦大学和腾讯混元的研究人员开发,采用动态稀疏注意力框架来高效处理高分辨率数据。这种方法允许模型根据局部内容调整其注意力结构,与全注意力相比,训练速度提高了2.5倍,同时提高了生成质量。
-
Hugging Face 强调 AI 推理加速和新技术 · 跟踪 3 个来源
Hugging Face 正在强调 AI 推理和速度方面的多项进展。该平台展示了“nunchaku”,一种集成到其 diffusers 库中的 4 位扩散推理技术。此外,Baseten 被认为是 Hugging Face 上的一个关键推理提供商,而 LiquidAI 的 LFM2.5-DSpark 技术据报道可将推理速度提高多达 3.2 倍。
-
OpenVDN 发布 VDN-Minimax-H3 以实现更快的视频生成
OpenVDN 发布了 VDN-Minimax-H3 (VDN-H3),这是一个开源视频生成模型,它利用混合注意力架构来实现更快的推理。该模型可以在八个 B200 GPU 上以 11.23 秒的速度生成一个 14.4 秒的视频片段,显著加快了视频创作速度。VDN-H3 基于 MiniMax H3 构建,并包含即插即用 LoRA 适配器,便于集成,模型权重和训练代码均公开可用。
-
Viggle-Animate 实现了无需姿态估计的快速视频角色替换
Viggle-Animate 是一个新的人工智能模型,它可以通过使用单个重绘帧来实现视频中的角色替换。该模型是 MiniMax-H3 的 ref2va transformer 的微调版本,绕过了对姿态骨骼或分割掩码等中间表示的需求。与之前的模型相比,它实现了显著更快的渲染时间,在单个 GPU 上 26 秒内处理了 124 帧。
-
LLaDA-Image:发布用于统一图像生成和编辑的开源模型
inclusionAI 发布了 LLaDA-Image,一个用于图像生成和编辑的开源统一模型。该模型系列包括一个用于高质量结果的 50 步基础模型和一个用于更快生成的 4 步蒸馏 Turbo 模型。LLaDA-Image 支持文本到图像生成、VQ 条件生成、参考图像编辑和多语言文本渲染,在 Qwen Image Bench 上取得了最先进的分数。
-
Alibaba-pai 发布 MiniMax-H3-Acc-LoRAs 以实现高效视频生成
Alibaba-pai 发布了 MiniMax-H3-Acc-LoRAs,一个专为高效视频生成设计的模型。该模型利用并行解码蒸馏(PDD)技术,在最少的推理步骤中实现快速视频创建。发布内容提供了与各种库和平台(包括 Google Colab 和 Kaggle)集成的说明,并引用了关于 PDD 加速生成的相关研究论文。
-
Hugging Face 聚焦多样化的AI工具和项目
Hugging Face 通过其博客展示了各种AI项目和工具。最近的帖子包括来自TII UAE的Falcon Perception、DeepInfra作为推理提供商的角色,以及Hcompany的AI浏览器合作伙伴HoloTab。此外,还展示了OpenAI的Web应用隐私过滤器、nunchaku的4位扩散推理集成到diffusers中,以及Baseten宣布成为Hugging Face推理提供商。
-
MiniMax AI 发布开源音乐模型,并在视频编辑基准测试中名列前茅
MiniMax AI 发布了 Minimax Music 3,这是一个开源的音乐生成模型,采用了 8B LLM 和 2.7B Diffusion Transformer。该模型能够根据文本提示和歌词生成完整的歌曲,并通过 diffusers 和 Comfy 等库在消费级 GPU 上运行。此外,MiniMax AI 还宣布其 H3 模型 MiniMax-H3 在 Video Edit Arena 中取得了最高排名,获得 1390 分,超…
-
MiniMax H3 模型通过 Sol Engine 实现重大速度提升
MiniMax AI 宣布使用 Sol Engine 显著提高了其 MiniMax H3 模型的速度。这款原生于代理的 Sol Video Inference Engine 比 Diffusers 快 3.95 倍,比 SGLang 快 2.80 倍。该引擎通过处理 8 个 Nvidia GB200 单元,在 1344x768 分辨率和 24 FPS 下处理 124 帧,展示了其能力。
-
本地 AI 更新:llama.cpp、PyTorch、Kimi-K3 和 NVIDIA NeMo Speech 3.0
本地 AI 和开源模型领域的最新更新包括 llama.cpp 通过 CUDA Fusion 实现的性能增强,解决了 PyTorch 中针对 AMD GPU 的关键量化错误,以及备受关注的 Moonshot AI Kimi-K3 模型,该模型利用压缩张量实现高效推理。此外,NVIDIA 发布了 NeMo Speech 3.0,专注于核心语音 AI 任务,LiquidAI 的 LFM2.5-2.6B 模型在本地代理部署方面也日益受到欢迎。
-
MiniMax Music 3 模型利用 Qwen3-8B LLM 生成完整歌曲
MiniMax Music 3,一个能够生成长达五分钟完整歌曲的新的开源模型已发布。该模型采用混合方法,结合了从 Qwen3-8B 初始化、用于长程结构的 8B 全局 LLM 和用于细粒度声学细节的 0.6B 局部 LLM。它可以根据歌词和详细的音乐描述进行条件生成,产生 32 kHz、16 位立体声 WAV 音频。该模型可通过 SGLang-Omni 和 diffusers 在本地使用,并通过 Hugging Face 和 audi…
-
llama.cpp 针对 Apple Silicon 进行优化,Hugging Face 提升 4 位扩散推理速度
最新发布的 llama.cpp 版本 b10299 为 Apple Silicon 引入了优化,通过 Metal API 提升了在 macOS 和 iOS 设备上的性能。此外,Hugging Face 详细介绍了其 Nunchaku 4 位扩散推理集成到 Diffusers 库中,显著降低了 VRAM 需求并加速了消费级 GPU 上的图像生成。NVIDIA NemotronLabs VoiceChat-11B 模型也在 Hugging…
-
Hugging Face 重点介绍新的推理提供商和 AI 工具 · 跟踪 4 个来源
Hugging Face 正在重点介绍几家正在增强其推理能力的公司和项目。DeepInfra 已被列为推理提供商,而 Hcompany 的 HoloTab 被介绍为 AI 浏览器合作伙伴。此外,Nunchaku 的 4 位扩散推理已集成到 diffusers 中,Baseten 也被宣布为该平台的推理提供商。
-
MiniMax AI发布H3视频模型开放权重,点燃社区创新
MiniMax AI已发布其MiniMax-H3视频模型的开放权重,在开源社区内引发了快速的创新。发布后的48小时内,用户在非传统硬件上展示了该模型的能力,包括低成本游戏GPU和MacBook,并开发了支持它的新工具。这种快速的采用和开发突显了社区对开放权重模型的参与度。
-
MiniMax H3 视频模型发布,权重开放,可通过平台访问
MiniMax AI 已正式发布其新的全模态生成系统 MiniMax H3,该系统能够生成具有同步立体声音频的视频,分辨率高达 2K,时长可达 15 秒。该模型现已在 Hugging Face 公开提供,并为不同用例提供了各种配置和权重,包括用于更快视频生成的 LoRA。尽管功能强大,但由于不断变化的 AI 法规,该模型在某些地区(如美国和欧盟)的可用性受到限制,但它正在被集成到秘塔AI等平台中,为创作者提供可访问、低成本的生成选项。
-
新的AI技术支持本地扩散模型和高性价比编码
一种名为Nunchaku的新的4位量化技术已集成到Hugging Face的Diffusers库中,在不牺牲质量的情况下显著减少了扩散模型所需的VRAM。这使得强大的生成式AI模型更容易在消费级硬件上本地部署。此外,还有关于在Windows和Linux上自托管AI代理(如Claude Cowork)的指南,支持本地任务自动化并增强隐私。文章还指出了使用Claude Opus等高级模型进行简单编码任务的成本效益低下,提倡对常规操作使用小…
-
Hugging Face 集成了 Nunchaku 用于 4 位扩散推理
Hugging Face 推出了 Nunchaku,一种新的 4 位扩散推理方法。该技术已集成到 diffusers 库中,旨在提高 AI 生成内容的效率。
-
Microsoft 发布 Mage-Flow,一款紧凑型 4B 图像生成模型
Microsoft 发布了 Mage-Flow,这是一款紧凑型 4B 规模的生成模型,专为高效的文本到图像生成和基于指令的图像编辑而设计。该模型通过协同设计的标记器 (Mage-VAE) 和多模态扩散 Transformer (NR-MMDiT) 实现了具有竞争力的质量,能够生成高达 2048 像素的原生分辨率图像。Mage-Flow 及其编辑变体 Mage-Flow-Edit 有基础版、RL 对齐版和 Turbo 版,与更大的模型相…
-
PEFT方法为大型语言模型提供高效微调
参数高效微调(PEFT)通过仅训练一小部分参数或添加轻量级组件,为适应新的任务提供了大型预训练模型的方法。这种方法与完全微调不同,它显著降低了GPU内存需求和检查点大小,从而能够创建小型、便携、特定任务的适配器。虽然LoRA和提示调优等PEFT方法不能保证与完全微调相同的性能,但它们大大降低了计算需求和存储成本。
-
NVIDIA发布Nemotron 3.5安全模型和NeMo AutoModel用于大规模微调 · 跟踪2个来源
NVIDIA发布了Nemotron 3.5,这是一个专为全球企业设计的多模态安全模型。该模型提供可定制的内容安全解决方案。此外,NVIDIA的NeMo AutoModel与Hugging Face的diffusers库结合使用,可以对视频和图像模型进行大规模微调。