PulseAugur
实时 11:33:44
实体 vllm-omni

vllm-omni

PulseAugur coverage of vllm-omni — every cluster mentioning vllm-omni across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-07-26 product_launch vLLM-Omni released version 0.25.0rc1, featuring speed improvements and new capabilities. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. SIGNIFICANT · CL_230929 ·

    MiniMax发布开源H3模型,用于实时视频生成

    MiniMax发布了其H3模型,该模型能够实时生成带有同步音频的视频。该模型基于vLLM-Omni和FastVideo的FastH3构建,可以在8.7秒内渲染一个10.1秒的MP4视频。该公司强调,这是一个开源版本,旨在利用NVIDIA AI硬件,促进社区的进一步发展和改进。

  2. TOOL · CL_217546 ·

    MiniMax AI 通过新的集成索引扩展 H3 生态系统

    MiniMax AI 正在通过一个名为“Awesome MiniMax H3 Integrations”的新索引来扩展其 H3 生态系统。该资源跟踪利用 H3 模型构建的社区项目,范围涵盖需要 24GB VRAM 的本地 ComfyUI 设置到使用 SGLang 和 vLLM-Omni 的大规模企业部署。该索引详细介绍了硬件优化、适用于不同 VRAM 限制的量化方法、服务加速技术以及开发工具,包括对 Apple Silicon 的支持。

  3. SIGNIFICANT · CL_178151 ·

    MiniMax AI 发布支持 vLLM 和 SGLang 的开源 H3 多模态模型

    MiniMax AI 发布了其 H3 模型的开放权重,该模型支持包括文本、图像和视频在内的多模态输入,并能生成带音频的视频。该模型现在可以在 vLLM-Omni 和 lmsysorg 的 SGLang Diffusion 等平台上获得 Day 0 支持。此举旨在使该模型更易于部署和构建,可在 NVIDIA 和 AMD 硬件上运行,并被定位为在快速发展的开源模型领域中的一个有竞争力的选择。

  4. TOOL · CL_172216 ·

    ByteShape 使用更小的 GGUF 和更快的 Humming 版本优化 Qwen Image 2512

    ByteShape 发布了 Qwen Image 2512 模型的优化版本,解决了 Qwen Image 2 和 3 闭源的性质。他们提供了紧凑的 GGUF 模型,比原始的 BF16 版本小得多,适用于各种平台。此外,ByteShape 还开发了利用 Humming 内核实现更快推理的 vLLM-Omni 版本,尽管目前仅限于 Linux 上的 Nvidia GPU。

  5. TOOL · CL_164176 ·

    vLLM-Omni 0.25.0rc1 提升 LLM 和 TTS 速度,增加 Krea 2 图像生成

    vLLM-Omni 平台已发布 0.25.0rc1 版本,与 vLLM 0.25 发布线保持一致。此次更新显著提升了大型语言模型 (LLM) 和文本转语音 (TTS) 的性能。值得注意的是,它增加了对 Krea 2(一个文本到图像生成模型)的支持,并改进了可组合并行执行和模型集成。

  6. TOOL · CL_86689 ·

    GF-DiT 通过动态并行优化 Diffusion Transformer 服务

    研究人员开发了 GF-DiT,一个新颖的运行时系统,旨在优化 Diffusion Transformers (DiTs) 的服务,DiTs 越来越多地用于图像和视频生成。与使用静态并行性的现有系统不同,GF-DiT 根据工作负载需求和服务目标动态调整 GPU 并行性。这是通过异步执行抽象和称为 group-free collectives 的通信抽象实现的,从而能够有效地在线重新分配 GPU 并减少通信开销。

  7. FRONTIER RELEASE · CL_79704 ·

    Google DeepMind 发布适用于笔记本电脑的 Gemma 4 12B 多模态模型

    Google DeepMind 发布了 Gemma 4 12B,这是一款专为在具有 16GB VRAM 的笔记本电脑上本地运行而设计的新型多模态模型。该模型采用新颖的统一架构,将音频和视觉输入直接集成到 LLM 主干中,无需单独的编码器,从而降低了延迟和内存使用量。Gemma 4 12B 旨在将先进的代理多模态能力带到日常硬件上,其性能接近其较大的 26B MoE 版本,并通过开放许可和与流行工具的集成获得广泛的开发者支持。

  8. MEME · CL_74928 ·

    LocalLLaMA 用户寻求为 llama.cpp 集成 TTS 和图像模型

    一位 r/LocalLLaMA 子版块的用户正在询问是否有适用于 llama.cpp 或 vLLM-Omni 等推理引擎的语音克隆和语音生成模型。目标是通过通用 API 无缝集成这些模型,而不是为每个模型管理单独的环境。该用户还对图像和视频生成模型表达了类似的兴趣。

  9. TOOL · CL_63924 ·

    Cosmos3 Nano 视频生成速度快,但分辨率受限

    一位用户分享了使用 vllm-omni 测试 Cosmos3 Nano 模型进行视频生成的体验。他们报告称速度惊人,在双 RTX 3090 设置下,不到 10 分钟就生成了一个 720x720 的视频。然而,在视频解码时尝试更高分辨率时遇到了内存不足的错误,并指出虽然图像到视频的质量尚可,但 nano 模型产生了一些伪影和涂抹。