OmniVoice
PulseAugur coverage of OmniVoice — every cluster mentioning OmniVoice across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
OmniVoice 微调以实现约鲁巴语零样本语音克隆
一位开发者对 OmniVoice 文本到语音模型进行了约鲁巴语的微调,约鲁巴语是一种声调语言,精确的发音对意义至关重要。该过程包括通过合并高质量的录音室录音和多样化的众包语音来构建数据集,总计约 156 位发言者的 9.6 小时数据。一个关键发现是,约鲁巴语中的变音符号不仅仅是格式,它们携带了重要的声调信息,并且保留它们对于准确和清晰的语音合成至关重要。
-
新的卢森堡语SQA系统使用TTS,发布新的表达式语音语料库
研究人员开发了LuxSQA,一个用于卢森堡语(一种资源匮乏的语言)的口语问答系统。该系统利用文本到语音(TTS)技术生成合成口语问题,扩充了现有的基于文本的QA资源。通过使用多种TTS系统训练参数高效的架构,LuxSQA在卢森堡语测试集上取得了优异的性能,证明了合成数据在资源匮乏的SQA中的有效性。另外,一个名为LuxEmo的新的卢森堡语表达式语音语料库已从广播节目中创建,包含21小时的数据,涵盖四种情绪类别,并使用五种TTS系统进行了基准测试。
-
AI语音生成器Omnivoice朗读古德语诗歌
一位Mastodon用户分享了AI生成的古德语诗歌《Muspilli》的音频朗读,并指出其声音非常像真人。该音频是使用Linux上的免费Omnivoice工具创建的,该工具还展示了翻译和朗读不再常用的古高地德语的能力。
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。
-
TTS Audio Suite v5.3 增加 OmniVoice 以实现精确字幕计时
TTS Audio Suite 已更新至 5.3 版本,引入了 OmniVoice,这是一款具有先进原生时长控制功能的文本转语音模型,用于字幕计时。此功能可实现生成音频与 SRT 字幕之间更精确的同步,减少后期调整的需求。此外,还增加了一个新的可视化标签构建器,最初用于帮助 OmniVoice 的指令字段,但已发展成为一个更通用的工具,用于可视化标签和属性的组织,可能有助于图像生成平台的提示。
-
免费AI工具高保真克隆声音
一款名为OmniVoice的新型免费AI工具现在可以克隆声音,包括之前由MIT降低质量模仿的巴拉克·奥巴马的声音。这项进步使得高保真声音克隆不再失真,并向公众开放。
-
OmniVoice 高精度克隆 GLaDOS 声音
文本转语音系统 OmniVoice 通过精确复制《传送门》系列电子游戏中的 AI 反派 GLaDOS 的声音,展示了其令人印象深刻的声音克隆能力。这一成就凸显了该系统在创建逼真合成语音方面的潜力。
-
OmniVoice 成为顶级本地文本转语音引擎
OmniVoice 是一个新推出的开源文本转语音系统,专为在 Linux 系统上本地运行而设计。该项目旨在提供高质量的语音合成,而无需依赖基于云的服务。其 GitHub 存储库提供了代码,供用户直接在自己的硬件上设置和运行 TTS 模型。
-
新的泰语语音克隆模型超越人类真实数据和商业旗舰模型
研究人员开发了 JaiTTS-v1.0,一个泰语语音克隆文本到语音模型,取得了最先进的成果,在短时语音生成方面,其词错误率(CER)为1.94%,超越了人类真实数据。该模型改编自VoxCPM,可以直接处理数字和泰英混合语,无需显式文本规范化。在人类评估中,JaiTTS-v1.0在绝大多数配对比较中优于商业旗舰模型。另外,另一项研究专注于科学语音的跨语言语音克隆,评估了基于OmniVoice的模型,并使用数据增强来提高可懂度,同时保持阿…