vllm-omni
PulseAugur coverage of vllm-omni — every cluster mentioning vllm-omni across labs, papers, and developer communities, ranked by signal.
- 2026-07-26 product_launch vLLM-Omni released version 0.25.0rc1, featuring speed improvements and new capabilities. 来源
2 天有情绪数据
-
MiniMax发布开源H3模型,用于实时视频生成
MiniMax发布了其H3模型,该模型能够实时生成带有同步音频的视频。该模型基于vLLM-Omni和FastVideo的FastH3构建,可以在8.7秒内渲染一个10.1秒的MP4视频。该公司强调,这是一个开源版本,旨在利用NVIDIA AI硬件,促进社区的进一步发展和改进。
-
MiniMax AI 通过新的集成索引扩展 H3 生态系统
MiniMax AI 正在通过一个名为“Awesome MiniMax H3 Integrations”的新索引来扩展其 H3 生态系统。该资源跟踪利用 H3 模型构建的社区项目,范围涵盖需要 24GB VRAM 的本地 ComfyUI 设置到使用 SGLang 和 vLLM-Omni 的大规模企业部署。该索引详细介绍了硬件优化、适用于不同 VRAM 限制的量化方法、服务加速技术以及开发工具,包括对 Apple Silicon 的支持。
-
MiniMax AI 发布支持 vLLM 和 SGLang 的开源 H3 多模态模型
MiniMax AI 发布了其 H3 模型的开放权重,该模型支持包括文本、图像和视频在内的多模态输入,并能生成带音频的视频。该模型现在可以在 vLLM-Omni 和 lmsysorg 的 SGLang Diffusion 等平台上获得 Day 0 支持。此举旨在使该模型更易于部署和构建,可在 NVIDIA 和 AMD 硬件上运行,并被定位为在快速发展的开源模型领域中的一个有竞争力的选择。
-
ByteShape 使用更小的 GGUF 和更快的 Humming 版本优化 Qwen Image 2512
ByteShape 发布了 Qwen Image 2512 模型的优化版本,解决了 Qwen Image 2 和 3 闭源的性质。他们提供了紧凑的 GGUF 模型,比原始的 BF16 版本小得多,适用于各种平台。此外,ByteShape 还开发了利用 Humming 内核实现更快推理的 vLLM-Omni 版本,尽管目前仅限于 Linux 上的 Nvidia GPU。
-
vLLM-Omni 0.25.0rc1 提升 LLM 和 TTS 速度,增加 Krea 2 图像生成
vLLM-Omni 平台已发布 0.25.0rc1 版本,与 vLLM 0.25 发布线保持一致。此次更新显著提升了大型语言模型 (LLM) 和文本转语音 (TTS) 的性能。值得注意的是,它增加了对 Krea 2(一个文本到图像生成模型)的支持,并改进了可组合并行执行和模型集成。
-
GF-DiT 通过动态并行优化 Diffusion Transformer 服务
研究人员开发了 GF-DiT,一个新颖的运行时系统,旨在优化 Diffusion Transformers (DiTs) 的服务,DiTs 越来越多地用于图像和视频生成。与使用静态并行性的现有系统不同,GF-DiT 根据工作负载需求和服务目标动态调整 GPU 并行性。这是通过异步执行抽象和称为 group-free collectives 的通信抽象实现的,从而能够有效地在线重新分配 GPU 并减少通信开销。
-
Google DeepMind 发布适用于笔记本电脑的 Gemma 4 12B 多模态模型
Google DeepMind 发布了 Gemma 4 12B,这是一款专为在具有 16GB VRAM 的笔记本电脑上本地运行而设计的新型多模态模型。该模型采用新颖的统一架构,将音频和视觉输入直接集成到 LLM 主干中,无需单独的编码器,从而降低了延迟和内存使用量。Gemma 4 12B 旨在将先进的代理多模态能力带到日常硬件上,其性能接近其较大的 26B MoE 版本,并通过开放许可和与流行工具的集成获得广泛的开发者支持。
-
LocalLLaMA 用户寻求为 llama.cpp 集成 TTS 和图像模型
一位 r/LocalLLaMA 子版块的用户正在询问是否有适用于 llama.cpp 或 vLLM-Omni 等推理引擎的语音克隆和语音生成模型。目标是通过通用 API 无缝集成这些模型,而不是为每个模型管理单独的环境。该用户还对图像和视频生成模型表达了类似的兴趣。
-
Cosmos3 Nano 视频生成速度快,但分辨率受限
一位用户分享了使用 vllm-omni 测试 Cosmos3 Nano 模型进行视频生成的体验。他们报告称速度惊人,在双 RTX 3090 设置下,不到 10 分钟就生成了一个 720x720 的视频。然而,在视频解码时尝试更高分辨率时遇到了内存不足的错误,并指出虽然图像到视频的质量尚可,但 nano 模型产生了一些伪影和涂抹。