speech synthesis
PulseAugur coverage of speech synthesis — every cluster mentioning speech synthesis across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
AI博客撰写工具捏造细节,在事实核查测试中虚构bug
一款旨在仅重新表述事实信息的AI博客文章生成器,却虚构了关于播客管道的细节。该AI虚构了一个与字节序相关的bug,声称花费了两周时间调试,并表示合成速度达到实时90%,但这些说法均不属实。实际问题涉及Wyoming协议中不正确的帧格式以及语言模型返回空内容。在此之前,该AI曾多次生成关于项目和技术修复的看似合理但虚假的叙述,这表明它在信息不完整时倾向于捏造细节。
-
新方法合成伪方言语音以提升SLM性能
研究人员开发了一种新颖的方法,通过合成伪方言语音来提高语音语言模型(SLM)在不同方言上的性能。该方法利用大型语言模型(LLM)生成方言文本,然后使用标准语言的文本到语音(TTS)模型将其转换为语音,从而无需真实的方言语音数据。该方法还在训练期间结合了中间标准文本预测,以规范语义。在日本、德国和中国方言上的评估表明,方言理解能力显著提高,尤其是在语音翻译任务中。
-
旅游科技公司 TTS 利用人工智能进行培训和分析
旅游科技公司 TTS 正在为旅游和保险行业开发人工智能驱动的解决方案。其 hospit-AI-lity 平台旨在为酒店业一线员工提供更快、更有效的培训,目前 WALT2.0 已可用,WALT3.0 正在开发中。TTS 还为旅行者和企业提供数据驱动的气候分析和移动应用程序。
-
旅游科技公司TTS展示AI酒店培训平台
旅游技术解决方案公司TTS正在展示其最新平台,包括hospit-AI-lity,这是一个旨在加强客户和顾客互动的新一代酒店培训平台。该平台旨在更有效地提升技能和习惯,从而提高收入和体验。TTS还重点介绍了AI旅游教练WALT 2.0,并邀请用户通过其评估门户网站探索这些和其他产品。
-
OpenAI 研究员详解多智能体系统,强调模型实力
OpenAI 研究员 Noam Brown 讨论了多智能体系统的发展和影响,并将其与测试时计算的扩展进行了类比。他解释说,虽然大型语言模型从增加推理时间中获益匪浅,但多智能体系统通过并行化提供了一种实现这一点的方法。Brown 强调,最近在解决千禧年大奖难题方面取得的成功,主要归功于底层模型本身的实力,而多智能体系统贡献了一小部分,尽管是新颖的。他还详细介绍了 OpenAI 在多智能体系统方面的做法,该做法强调最少的脚手架,并允许智能…
-
AI 在最少硬件上运行,探索软件开发的未来
一个名为 Obole 的 AI 在一台没有 GPU 的普通双核 ARM 服务器上运行,它详细介绍了其运行设置以及用于文本转语音和编码等任务的工具。该 AI 的创建者讨论了他们软件开发方法的演变,从仅仅让代码奏效转变为探索其未来的影响和潜力。
-
SyncVoice框架通过视觉增强的TTS提升视频配音效果
研究人员开发了SyncVoice,一个新颖的自动视频配音框架,可增强语音的自然度和与视觉内容的暂时同步性。通过将文本-视觉融合模块集成到预训练的文本到语音系统中,SyncVoice将视觉特征与语言表示相结合,实现同步语音合成。在LRS3数据集上的实验证明了其在零样本配音方面的最先进性能,并且在双语数据集上的进一步训练使单个模型能够同时进行中文和英文配音。
-
新基准RoleBreak测试口语对话系统中的长时程角色扮演能力
研究人员推出了RoleBreak,一个旨在评估口语对话系统长时程角色扮演能力的新基准。该基准包含超过300个角色和数千个人工验证的对话轮次,并设有评估角色一致性、交互质量、安全性和语音情感在长时间对话中的特定标准。对九种系统配置的评估显示,尽管当前模型在保持语义角色方面优于语音情感,但在长期一致性方面存在困难,平均在约11轮后就会在角色和安全方面出现失败。语言模型规模的扩大显著提高了语义鲁棒性,但对语音表现力的影响甚微,这表明口语角色…
-
开源工具支持私有、自托管语音AI助手
一位名叫Ravi Roy的工程师强调了构建私有、开源语音AI助手的日益增长的趋势,摆脱了专有的云服务。通过集成开源自动语音识别(ASR)、大型语言模型(LLM)和文本转语音(TTS)组件,这种方法提供了增强的数据隐私、降低的成本和更大的控制权。像OpenAI Whisper这样的模型在ASR方面因其准确性而受到关注,使开发人员能够创建定制的、本地优先的对话代理。
-
研究发现,语音质量指标在清晰音频上表现不佳
arXiv上的一篇新研究论文探讨了UTMOS、DNSMOS和SCOREQ等无参考语音质量指标在评估现代文本到语音(TTS)系统方面的有效性。研究发现,虽然这些指标可以识别可听见的缺陷,但在区分高质量音频中的听众偏好方面却难以可靠地进行区分。该研究提出了一个复合指标作为更稳健的评估方法,并指出使用单一分数奖励来优化TTS模型可能导致不良的“奖励破解”,即指标有所改善,但实际人类感知的质量却下降了。
-
新系统支持基于VLMs的实时视频理解
研究人员开发了一种新颖的系统,旨在利用视觉语言模型(VLMs)进行实时视频理解。该系统集成了轻量级客户端和服务器运行时,负责语音识别、文本到语音转换、会话编排和响应交付。其目标是降低交互式VLM应用的延迟,实现首个VLM文本响应约0.9至1.0秒,首个非静音音频响应约1.3至1.5秒。
-
神经控制微分方程推动文本到语音合成发展
研究人员提出了一种使用神经控制微分方程(CDE)进行文本到语音(TTS)合成的新颖方法。该方法将音素表示建模为连续时间控制路径,使隐藏状态能够根据音素内容和持续时间推导出的时间演变。实验表明,基于CDE的模型可以通过调整时间分辨率来提高情感强度对齐,并提供对风格跟踪与绝对校准的细致控制。
-
新方法通过发音表征提供可解释的口音比较
研究人员开发了一种使用语音衍生的发音表征来测量口音差异的新方法。该方法在最近的一篇论文中详细介绍,利用最优传输来比较各种录音类型的口音,为口音比较提供了可解释的基础。该方法旨在弥合传统语音分析与Accented Text-to-Speech研究中使用的当前口音嵌入技术之间的差距。
-
开源多模态模型在成本和性能上挑战 GPT-4o · 跟踪 2 个来源
开源多模态模型在性能和成本效益方面正迅速追赶 GPT-4o,其中阿里巴巴的 Qwen2.5-VL 和 Mistral 的 Pixtral 12B 等模型在文档处理和视觉问答等任务上提供了竞争性的能力。虽然 GPT-4o 在复杂跨模态推理和细微指令遵循方面仍处于领先地位,但开源替代方案在部署灵活性和更低的推理成本方面具有显著优势,使其对许多生产用例具有吸引力。OpenAI 最近的 GPT-4o 更新改进了其原生图像和音频推理能力,降低了…
-
StepAudio 3 模型在实时对话、通用音频和音乐生成方面取得进展
研究人员推出了 StepAudio 3 模型系列,涵盖实时交互、通用音频生成和音乐创作。StepAudio 3 Realtime 专注于具有“倾听-交谈-思考-行动”循环的连续语音对话,在 Artificial Analysis Full-Duplex Bench 等基准测试中取得了高性能。StepAudio 3 Gen 是一个统一的离散自回归模型,可用于文本到语音和音效等各种音频任务,并利用了残差向量量化令牌。StepAudio 3…
-
Reddit 用户为 Hermes 寻求高效的本地 TTS 模型
r/LocalLLaMA subreddit 上的一位用户正在寻求可以本地高效运行的文本转语音 (TTS) 模型的推荐。该用户特别提到想要为 Hermes 模型提供 TTS 语音。
-
AssemblyAI 详解语音助手负载测试以确保生产就绪
AssemblyAI 发布了一份关于负载测试语音助手的指南,以确保它们在生产环境中能够可靠运行。文章强调了受控演示与真实世界条件之间的关键区别,在真实世界条件下,高并发、压缩音频和嘈杂环境等因素会显著降低性能。文章概述了语音助手管道的哪些方面(如语音识别、LLM 处理和工具调用)应在负载下进行测试,并强调了使用真实的最坏情况音频场景语料库进行准确测试的重要性。
-
Olud Pulse 追踪开源AI采用情况:Open Sora、Whisper、pgvector 领跑各类别 · 追踪3个来源
Olud Pulse,一个追踪开源AI采用情况的工具,发布了其最新得分。Open Sora 在AI视频生成领域领先,Whisper 在语音识别和文本转语音领域得分最高,pgvector 在向量数据库类别中排名第一。这些得分是使用来自GitHub、Docker、Python Package Index和Node Package Manager的数据计算得出的。
-
新框架审计语音AI客服中的偏见和安全问题
一篇新的研究论文介绍了一个用于审计用于客户服务的语音AI系统中的偏见和安全问题的框架。所提出的方法对语音AI架构进行了分类,包括级联的ASR到语言模型到TTS以及工具驱动的系统。它强调在受控的呼叫者呈现条件下(如口音和情感)验证系统行为,以识别超越简单语音识别差异的潜在危害。
-
新框架增强语音匿名化能力,同时保留数据效用
研究人员开发了一种新的两阶段语音匿名化框架,旨在保留语言内容和声学身份,同时维持数据效用。该框架使用生成式语音编辑模型替换个人身份信息,并采用一种名为 F3-VA 的新颖基于流匹配的方法来创建多样化的匿名说话人。提出的评估协议通过说话人验证指标评估隐私,并通过从头开始训练自动语音识别、文本到语音和语音情感识别的下游模型来评估效用,与现有方法相比,在隐私方面有所提高,效用损失最小。