vllm-omni
PulseAugur coverage of vllm-omni — every cluster mentioning vllm-omni across labs, papers, and developer communities, ranked by signal.
-
GF-DiT 通过动态并行优化 Diffusion Transformer 服务
研究人员开发了 GF-DiT,一个新颖的运行时系统,旨在优化 Diffusion Transformers (DiTs) 的服务,DiTs 越来越多地用于图像和视频生成。与使用静态并行性的现有系统不同,GF-DiT 根据工作负载需求和服务目标动态调整 GPU 并行性。这是通过异步执行抽象和称为 group-free collectives 的通信抽象实现的,从而能够有效地在线重新分配 GPU 并减少通信开销。
-
Google DeepMind 发布适用于笔记本电脑的 Gemma 4 12B 多模态模型
Google DeepMind 发布了 Gemma 4 12B,这是一款专为在具有 16GB VRAM 的笔记本电脑上本地运行而设计的新型多模态模型。该模型采用新颖的统一架构,将音频和视觉输入直接集成到 LLM 主干中,无需单独的编码器,从而降低了延迟和内存使用量。Gemma 4 12B 旨在将先进的代理多模态能力带到日常硬件上,其性能接近其较大的 26B MoE 版本,并通过开放许可和与流行工具的集成获得广泛的开发者支持。
-
LocalLLaMA 用户寻求为 llama.cpp 集成 TTS 和图像模型
一位 r/LocalLLaMA 子版块的用户正在询问是否有适用于 llama.cpp 或 vLLM-Omni 等推理引擎的语音克隆和语音生成模型。目标是通过通用 API 无缝集成这些模型,而不是为每个模型管理单独的环境。该用户还对图像和视频生成模型表达了类似的兴趣。
-
Cosmos3 Nano 视频生成速度快,但分辨率受限
一位用户分享了使用 vllm-omni 测试 Cosmos3 Nano 模型进行视频生成的体验。他们报告称速度惊人,在双 RTX 3090 设置下,不到 10 分钟就生成了一个 720x720 的视频。然而,在视频解码时尝试更高分辨率时遇到了内存不足的错误,并指出虽然图像到视频的质量尚可,但 nano 模型产生了一些伪影和涂抹。