PulseAugur
实时 20:04:38
实体 VibeVoice

VibeVoice

PulseAugur coverage of VibeVoice — every cluster mentioning VibeVoice across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-08-05 product_launch The VibeVoice 1.5B model was demonstrated running locally on an iPhone. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. MEME · CL_228063 ·

    Reddit用户寻求最佳带说话人分离的ASR模型

    r/LocalLLaMA subreddit上的一位用户正在寻求推荐一款支持说话人分离的最佳自动语音识别(ASR)模型。他们之前使用过vibevoice,但发现它资源消耗大,正在寻找更准确、更高效的替代方案。该用户正在浏览Hugging Face的公开ASR排行榜和社区经验,以找到适合转录一小时长咨询录音的模型。

  2. TOOL · CL_182855 ·

    VibeVoice 1.5B 模型可在 iPhone 上本地运行

    一个名为 VibeVoice 的 15 亿参数语言模型已成功在 iPhone 上本地运行,仅使用了约 2.2 GB 的内存。该模型实现的生成速度最高可达实时速度的 1.28 倍。此举是集成该模型到 audio.cpp 框架的一部分,并计划在 0.6 版本发布后发布代码和 xcframework。

  3. TOOL · CL_119337 ·

    audio.cpp 通过 C++/GGML 添加音乐、SFX 和长篇 TTS 模型

    audio.cpp 项目发布了重大更新,引入了对 ACE-Step、Stable Audio、HeartMuLa、RoFormer 和 HTDemucs 等新音频模型的原生 C++/GGML 支持。此次扩展支持音乐和 SFX 生成以及声源分离,其中一些模型现在能够生成长达10分钟的音频。此外,还集成了 VibeVoice 1.5B,在长篇 TTS 方面表现出色,在 RTX 5090 上不到23分钟即可生成90分钟的音频,显著优于基于 …

  4. TOOL · CL_69827 ·

    开源AI模型生成角色驱动的奇幻故事

    一位用户使用包括LTX 2.3、ZiT、Klein和VibeVoice在内的一系列本地开源AI模型创作了一个奇幻故事。该项目展示了这些模型生成以角色为中心的叙事的能力。创作者在Reddit帖子的评论区分享了他们的过程和经验的细节。

  5. TOOL · CL_17984 ·

    Google的Gemma 4增加了MTP以加快本地推理速度,VibeVoice已移植到C++,Ollama获得桌面层

    Google发布了Gemma 4,其中包含多令牌预测(MTP)功能,该功能允许模型同时预测多个令牌,从而显著加快本地推理速度。此外,使用ggml库开发了Microsoft VibeVoice模型的C++端口vibevoice.cpp,无需Python即可在消费级硬件上实现先进的语音到文本和文本到语音功能。还有一个独立项目正在进行中,旨在为Ollama创建一个离线的、低内存占用的桌面应用程序,以简化对技术水平较低用户的本地LLM部署。

  6. RESEARCH · CL_07571 ·

    Microsoft 开源 VibeVoice 用于长篇语音AI

    Microsoft 已开源 VibeVoice,这是一套先进的语音AI模型。VibeVoice 系列包含文本到语音(TTS)和自动语音识别(ASR)功能。一项关键创新是使用了连续语音分词器,它们可以高效地处理长音频序列,在降低计算负载的同时保持保真度。

  7. RESEARCH · CL_05933 ·

    Microsoft发布VibeVoice,一款开源语音转文本AI模型

    Microsoft发布了VibeVoice,一个内置说话人日志功能的开源语音转文本模型。该模型采用MIT许可,可本地部署,意味着音频数据无需发送至API。一位用户在MacBook Pro上测试了该模型,在不到九分钟的时间内转录了一小时的音频,但需要大量内存。