LiveKit
PulseAugur coverage of LiveKit — every cluster mentioning LiveKit across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
AssemblyAI 指导使用 STT-LLM-TTS 架构构建实时语音代理
AssemblyAI 正在详细介绍如何使用连接语音识别 (STT)、大型语言模型 (LLM) 和文本转语音 (TTS) 组件的链式架构来构建实时语音代理。该公司强调低延迟流式管道的重要性,并就集成其 Universal 3.5 Pro Realtime STT 模型提供了具体指导。文章还探讨了 Vapi、Pipecat 和 LiveKit 等不同的编排平台,并讨论了从 Retell 和 Super 等公司吸取的关于生产级语音代理需求的…
-
AI 语音导师 Bhasha Academy 使用 Gemini 和 Murf Falcon 构建
一位开发者创建了 Bhasha Academy,这是一个由 AI 驱动的语音导师,旨在帮助印度的学生练习英语和基础数学。该应用程序支持 Hinglish 对话,提供具有持久记忆的个性化学习,并在必要时可以升级到人工教师。该系统利用 Deepgram Nova-3 进行语音转文本,使用 Google Gemini 3.5 Flash Lite 进行对话式 AI,并使用 Murf Falcon TTS 进行语音生成,所有这些都通过 Liv…
-
AI语音技术从研究走向实际应用
人工智能语音技术的最新进展在多个领域得到体现,从语音克隆和检测的学术研究到联络中心和个性化学习伴侣的实际应用。一篇arXiv上的调查论文详细介绍了AI生成语音及其检测的复杂性,并指出了诸如冒充和虚假信息等风险。与此同时,Cartesia的Sonic-3.6 TTS模型在语音排行榜上名列前茅,提供低延迟的实时合成。包括ShikshaMitra AI、RupeeGPT、Aarogyam、Sydney和EduGuideAI在内的多个项目,展…
-
AssemblyAI 通过上下文携带增强语音代理转录
AssemblyAI 推出了名为 Agent Context Carryover 的新功能,旨在提高语音代理转录的准确性。此功能允许语音转文本模型保持对正在进行的对话的感知,包括代理之前的回复和用户的先前输入。通过一个设置启用此上下文感知,AssemblyAI 旨在消除对手动关键词列表或自定义词汇表的需求,从而简化语音代理的开发过程。该公司通过为虚构餐厅 Le Périgord Fusion 构建语音代理来展示此功能,该餐厅的菜单包含…
-
Fish Audio 获 5000 万美元种子轮融资用于 AI 语音模型,服务 800 万用户
专注于 AI 语音模型的初创公司 Fish Audio 已获得 5000 万美元的种子轮融资。该公司提供开源和托管解决方案,拥有超过 15,000 个自然语言控制选项,可满足创作者和企业客户的需求。Fish Audio 目前拥有 800 万用户,年经常性收入为 2100 万美元。尽管过去曾因语音数据同意问题引发争议,此次融资将用于支持更先进的模型和企业功能的开发。
-
AssemblyAI 的 Universal-3.5 Pro Realtime 在速度和准确性上达到人类水平
AssemblyAI 的 Universal-3.5 Pro Realtime 模型通过成为独立语音转文本排行榜上 Coval 人类水平区域的唯一参赛者,取得了重大里程碑。该区域表示模型在准确性和速度上均达到或超越人类表现。该模型展示了 3.40% 的词错误率,在 29 个模型中排名最低,并且实现了最快的首个 token 时间,表明了自然的对话流畅度。在准确性和速度上的双重成就对于语音代理至关重要,能够使它们准确聆听并迅速响应。
-
AI 管道使用 Grok 和 Deepgram 实时分析面试
本文详细介绍了 TrueVoice HQ 的架构,这是一个专为实时面试分析设计的 AI 平台。该系统使用 LiveKit 和 Deepgram 处理音视频流进行转录,Supabase Edge Functions 利用 Grok 在转录块生成时对其进行分析。这种基于块的方法允许面试官每 30-60 秒收到一次实时评分更新,从而立即获得关于语音模式、时机、流程和语言风格的反馈,而不是等待面试后报告。该管道还包括处理和提取 LLM 的结构…
-
AssemblyAI 和 LiveKit 简化语音代理开发
AssemblyAI 和 LiveKit 合作简化了语音代理的创建。第一种方法将 AssemblyAI 的 Voice Agent API 与 LiveKit 的 WebRTC 功能集成,通过单个 WebSocket 连接处理整个 AI 管道——语音转文本、LLM 和文本转语音。第二种方法利用 LiveKit Agents 框架,允许开发人员编排专门的模型,例如 AssemblyAI 的 Universal-3.5 Pro Realt…
-
语音AI初创公司Rime融资2400万美元A轮,用于企业呼叫处理
语音AI初创公司Rime已获得2400万美元A轮融资,以增强其处理企业客户来电的能力。该公司通过收集自己的对话数据来减少客户定制需求并提高模型性能,专注于专业术语和发音,从而实现差异化。尽管取得了进展,Rime承认语音AI在完全取代传统IVR系统方面仍面临挑战,因为用户体验存在局限性。
-
使用 LiveKit 构建内部 HIPAA 合规语音代理
本文提供了一个关于构建完全内部化的 HIPAA 合规语音代理的指南,确保受保护的健康信息 (PHI) 掌握在用户手中。它详细介绍了设置自托管 LiveKit 语音代理的过程,强调了医疗保健应用程序中数据隐私和安全的重要性。
-
AssemblyAI 提供无框架语音代理架构
AssemblyAI 推出了新的无框架语音代理构建架构,挑战了 Pipecat 和 LiveKit 等工具的必要性。他们的方法将语音转文本、LLM 和文本转语音功能整合到单个 WebSocket 连接中,简化了流程并减少了依赖。这种方法旨在通过在一个 API 中管理轮流对话和中断来简化开发,这与需要单独编排框架的传统多供应商设置形成对比。
-
Google 发布 Gemini 3.5 Live Translate 实现实时语音翻译
Google 推出了 Gemini 3.5 Live Translate,这是一款先进的音频模型,专为实时语音到语音翻译而设计。该新模型支持 70 多种语言,可以连续翻译,在不出现尴尬停顿的情况下保留说话者的语调和语速。Gemini 3.5 Live Translate 正在集成到 Google Meet 和 Google Translate 应用等各种 Google 产品中,并且通过 Gemini Live API 和 Google…
-
AethexAI为非洲和中东的语音AI融资300万美元
AethexAI是一家专注于为非洲和中东被忽视的市场开发语音AI的初创公司,已获得300万美元的种子前融资。该公司通过构建自己的小型语言模型和编排层来处理区域方言和降低延迟,而不是依赖现有工具,从而实现差异化。AethexAI的平台目前每天为企业处理超过17,000通电话,重点关注催收和客户验证等用例。
-
Glad Labs 通过改进的错误处理和测试来增强 MCP 平台
Glad Labs 通过解决静默故障和增强可观察性,显著改进了其 MCP 平台。主要更新包括将语音桥接修复为响亮失败而非静默失败,重新启用 CI 中先前跳过的测试以捕获更多问题,并通过删除时间戳后缀来稳定告警指纹。团队还通过添加一个选项来抑制特定的容器缺失告警,并继续将服务从单例重构,从而优化了 GPU 服务监控。
-
xAI 发布 Grok 文本转语音 API,提供自然、低延迟的语音
xAI 推出了其 Grok 文本转语音 API,使开发人员能够将其自然且富有表现力的语音功能集成到他们的应用程序中。该 API 支持低延迟流式传输,并且是多语言的,提供 20 多种语言。它设计用于轻松集成,只需一个 API 密钥,无需额外的电话或生产环境设置。
-
Google DeepMind 发布 Gemini 3.1 Flash TTS、Live 和 Lite 模型
Google DeepMind 推出了一系列 Gemini 3.1 Flash 模型,包括用于高级文本到语音的 Flash TTS、用于实时对话的 Flash Live 以及用于成本高效、大批量工作负载的 Flash-Lite。这些模型提供了改进的自然度、表现力和速度,其中 Flash TTS 在语音质量基准测试中获得了高 Elo 分数,Flash Live 在复杂任务完成方面表现强劲。TTS 和 Live 模型生成的所有音频都使用 …